{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.82648401826484, "eval_steps": 0, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0182648401826484, "grad_norm": 1.210837721824646, "learning_rate": 8.384962462644227e-05, "loss": 4.3885, "step": 10 }, { "epoch": 0.0365296803652968, "grad_norm": 0.05364489555358887, "learning_rate": 9.403937698096759e-05, "loss": 0.0377, "step": 20 }, { "epoch": 0.0547945205479452, "grad_norm": 0.05466941371560097, "learning_rate": 0.0001, "loss": 0.0304, "step": 30 }, { "epoch": 0.0730593607305936, "grad_norm": 0.05443768575787544, "learning_rate": 0.0001, "loss": 0.0286, "step": 40 }, { "epoch": 0.091324200913242, "grad_norm": 0.04316823184490204, "learning_rate": 0.0001, "loss": 0.0269, "step": 50 }, { "epoch": 0.1095890410958904, "grad_norm": 0.040838971734046936, "learning_rate": 0.0001, "loss": 0.0253, "step": 60 }, { "epoch": 0.1278538812785388, "grad_norm": 0.033302322030067444, "learning_rate": 0.0001, "loss": 0.0246, "step": 70 }, { "epoch": 0.1461187214611872, "grad_norm": 0.033719729632139206, "learning_rate": 0.0001, "loss": 0.0236, "step": 80 }, { "epoch": 0.1643835616438356, "grad_norm": 0.035154491662979126, "learning_rate": 0.0001, "loss": 0.0225, "step": 90 }, { "epoch": 0.182648401826484, "grad_norm": 0.04473581910133362, "learning_rate": 0.0001, "loss": 0.0215, "step": 100 }, { "epoch": 0.2009132420091324, "grad_norm": 0.03445715084671974, "learning_rate": 0.0001, "loss": 0.0206, "step": 110 }, { "epoch": 0.2191780821917808, "grad_norm": 0.038836944848299026, "learning_rate": 0.0001, "loss": 0.0192, "step": 120 }, { "epoch": 0.2374429223744292, "grad_norm": 0.03825332224369049, "learning_rate": 0.0001, "loss": 0.0175, "step": 130 }, { "epoch": 0.2557077625570776, "grad_norm": 0.06607168912887573, "learning_rate": 0.0001, "loss": 0.0163, "step": 140 }, { "epoch": 0.273972602739726, "grad_norm": 0.06894340366125107, "learning_rate": 0.0001, "loss": 0.0145, "step": 150 }, { "epoch": 0.2922374429223744, "grad_norm": 0.05710868164896965, "learning_rate": 0.0001, "loss": 0.0135, "step": 160 }, { "epoch": 0.3105022831050228, "grad_norm": 0.21631816029548645, "learning_rate": 0.0001, "loss": 0.0124, "step": 170 }, { "epoch": 0.3287671232876712, "grad_norm": 0.02653978019952774, "learning_rate": 0.0001, "loss": 0.0108, "step": 180 }, { "epoch": 0.3470319634703196, "grad_norm": 0.02567458152770996, "learning_rate": 0.0001, "loss": 0.0096, "step": 190 }, { "epoch": 0.365296803652968, "grad_norm": 0.02634381130337715, "learning_rate": 0.0001, "loss": 0.009, "step": 200 }, { "epoch": 0.3835616438356164, "grad_norm": 0.0267449039965868, "learning_rate": 0.0001, "loss": 0.0082, "step": 210 }, { "epoch": 0.4018264840182648, "grad_norm": 0.021301211789250374, "learning_rate": 0.0001, "loss": 0.0074, "step": 220 }, { "epoch": 0.4200913242009132, "grad_norm": 0.019044479355216026, "learning_rate": 0.0001, "loss": 0.0065, "step": 230 }, { "epoch": 0.4383561643835616, "grad_norm": 0.029325349256396294, "learning_rate": 0.0001, "loss": 0.0058, "step": 240 }, { "epoch": 0.45662100456621, "grad_norm": 0.020611237734556198, "learning_rate": 0.0001, "loss": 0.005, "step": 250 }, { "epoch": 0.4748858447488584, "grad_norm": 0.013526758179068565, "learning_rate": 0.0001, "loss": 0.0048, "step": 260 }, { "epoch": 0.4931506849315068, "grad_norm": 0.013649986125528812, "learning_rate": 0.0001, "loss": 0.0044, "step": 270 }, { "epoch": 0.5114155251141552, "grad_norm": 0.010144168511033058, "learning_rate": 0.0001, "loss": 0.0039, "step": 280 }, { "epoch": 0.5296803652968036, "grad_norm": 0.010870883241295815, "learning_rate": 0.0001, "loss": 0.0037, "step": 290 }, { "epoch": 0.547945205479452, "grad_norm": 0.013004078529775143, "learning_rate": 0.0001, "loss": 0.0035, "step": 300 }, { "epoch": 0.5662100456621004, "grad_norm": 0.011805733665823936, "learning_rate": 0.0001, "loss": 0.0032, "step": 310 }, { "epoch": 0.5844748858447488, "grad_norm": 0.009305172599852085, "learning_rate": 0.0001, "loss": 0.0032, "step": 320 }, { "epoch": 0.6027397260273972, "grad_norm": 0.010236217640340328, "learning_rate": 0.0001, "loss": 0.0032, "step": 330 }, { "epoch": 0.6210045662100456, "grad_norm": 0.006890588905662298, "learning_rate": 0.0001, "loss": 0.0029, "step": 340 }, { "epoch": 0.639269406392694, "grad_norm": 0.009779484011232853, "learning_rate": 0.0001, "loss": 0.0029, "step": 350 }, { "epoch": 0.6575342465753424, "grad_norm": 0.00785751547664404, "learning_rate": 0.0001, "loss": 0.0028, "step": 360 }, { "epoch": 0.6757990867579908, "grad_norm": 0.0072973244823515415, "learning_rate": 0.0001, "loss": 0.0029, "step": 370 }, { "epoch": 0.6940639269406392, "grad_norm": 0.007814369164407253, "learning_rate": 0.0001, "loss": 0.0026, "step": 380 }, { "epoch": 0.7123287671232876, "grad_norm": 0.009240522980690002, "learning_rate": 0.0001, "loss": 0.0027, "step": 390 }, { "epoch": 0.730593607305936, "grad_norm": 0.009443056769669056, "learning_rate": 0.0001, "loss": 0.0026, "step": 400 }, { "epoch": 0.7488584474885844, "grad_norm": 0.007976274006068707, "learning_rate": 0.0001, "loss": 0.0025, "step": 410 }, { "epoch": 0.7671232876712328, "grad_norm": 0.007670409046113491, "learning_rate": 0.0001, "loss": 0.0026, "step": 420 }, { "epoch": 0.7853881278538812, "grad_norm": 0.007698874454945326, "learning_rate": 0.0001, "loss": 0.0026, "step": 430 }, { "epoch": 0.8036529680365296, "grad_norm": 0.0064626955427229404, "learning_rate": 0.0001, "loss": 0.0023, "step": 440 }, { "epoch": 0.821917808219178, "grad_norm": 0.00718158483505249, "learning_rate": 0.0001, "loss": 0.0026, "step": 450 }, { "epoch": 0.8401826484018264, "grad_norm": 0.00720883859321475, "learning_rate": 0.0001, "loss": 0.0024, "step": 460 }, { "epoch": 0.8584474885844748, "grad_norm": 0.0070312367752194405, "learning_rate": 0.0001, "loss": 0.0022, "step": 470 }, { "epoch": 0.8767123287671232, "grad_norm": 0.006656646262854338, "learning_rate": 0.0001, "loss": 0.0022, "step": 480 }, { "epoch": 0.8949771689497716, "grad_norm": 0.005672188475728035, "learning_rate": 0.0001, "loss": 0.0023, "step": 490 }, { "epoch": 0.91324200913242, "grad_norm": 0.006890942342579365, "learning_rate": 0.0001, "loss": 0.0023, "step": 500 }, { "epoch": 0.9315068493150684, "grad_norm": 0.007466984912753105, "learning_rate": 0.0001, "loss": 0.0023, "step": 510 }, { "epoch": 0.9497716894977168, "grad_norm": 0.004908357746899128, "learning_rate": 0.0001, "loss": 0.0023, "step": 520 }, { "epoch": 0.9680365296803652, "grad_norm": 0.006489965599030256, "learning_rate": 0.0001, "loss": 0.0022, "step": 530 }, { "epoch": 0.9863013698630136, "grad_norm": 0.004896162543445826, "learning_rate": 0.0001, "loss": 0.0022, "step": 540 }, { "epoch": 1.004566210045662, "grad_norm": 0.006576609797775745, "learning_rate": 0.0001, "loss": 0.0022, "step": 550 }, { "epoch": 1.0228310502283104, "grad_norm": 0.005738385953009129, "learning_rate": 0.0001, "loss": 0.0022, "step": 560 }, { "epoch": 1.0410958904109588, "grad_norm": 0.004859850741922855, "learning_rate": 0.0001, "loss": 0.0021, "step": 570 }, { "epoch": 1.0593607305936072, "grad_norm": 0.0058967191725969315, "learning_rate": 0.0001, "loss": 0.0022, "step": 580 }, { "epoch": 1.0776255707762556, "grad_norm": 0.006550053600221872, "learning_rate": 0.0001, "loss": 0.0022, "step": 590 }, { "epoch": 1.095890410958904, "grad_norm": 0.005125932861119509, "learning_rate": 0.0001, "loss": 0.002, "step": 600 }, { "epoch": 1.1141552511415524, "grad_norm": 0.006288828328251839, "learning_rate": 0.0001, "loss": 0.0021, "step": 610 }, { "epoch": 1.1324200913242009, "grad_norm": 0.005583199672400951, "learning_rate": 0.0001, "loss": 0.0021, "step": 620 }, { "epoch": 1.1506849315068493, "grad_norm": 0.009129468351602554, "learning_rate": 0.0001, "loss": 0.0021, "step": 630 }, { "epoch": 1.1689497716894977, "grad_norm": 0.007402694784104824, "learning_rate": 0.0001, "loss": 0.002, "step": 640 }, { "epoch": 1.187214611872146, "grad_norm": 0.006056242622435093, "learning_rate": 0.0001, "loss": 0.0019, "step": 650 }, { "epoch": 1.2054794520547945, "grad_norm": 0.006746839266270399, "learning_rate": 0.0001, "loss": 0.0021, "step": 660 }, { "epoch": 1.2237442922374429, "grad_norm": 0.005732604302465916, "learning_rate": 0.0001, "loss": 0.0019, "step": 670 }, { "epoch": 1.2420091324200913, "grad_norm": 0.005662497598677874, "learning_rate": 0.0001, "loss": 0.0019, "step": 680 }, { "epoch": 1.2602739726027397, "grad_norm": 0.005395127926021814, "learning_rate": 0.0001, "loss": 0.002, "step": 690 }, { "epoch": 1.278538812785388, "grad_norm": 0.006477879825979471, "learning_rate": 0.0001, "loss": 0.002, "step": 700 }, { "epoch": 1.2968036529680365, "grad_norm": 0.00455828383564949, "learning_rate": 0.0001, "loss": 0.0018, "step": 710 }, { "epoch": 1.3150684931506849, "grad_norm": 0.006546813528984785, "learning_rate": 0.0001, "loss": 0.0019, "step": 720 }, { "epoch": 1.3333333333333333, "grad_norm": 0.004749835003167391, "learning_rate": 0.0001, "loss": 0.002, "step": 730 }, { "epoch": 1.3515981735159817, "grad_norm": 0.0060322824865579605, "learning_rate": 0.0001, "loss": 0.002, "step": 740 }, { "epoch": 1.36986301369863, "grad_norm": 0.004833315033465624, "learning_rate": 0.0001, "loss": 0.0019, "step": 750 }, { "epoch": 1.3881278538812785, "grad_norm": 0.006321150343865156, "learning_rate": 0.0001, "loss": 0.0018, "step": 760 }, { "epoch": 1.4063926940639269, "grad_norm": 0.00560184707865119, "learning_rate": 0.0001, "loss": 0.002, "step": 770 }, { "epoch": 1.4246575342465753, "grad_norm": 0.005110142752528191, "learning_rate": 0.0001, "loss": 0.0018, "step": 780 }, { "epoch": 1.4429223744292237, "grad_norm": 0.005219564773142338, "learning_rate": 0.0001, "loss": 0.0019, "step": 790 }, { "epoch": 1.461187214611872, "grad_norm": 0.004923923406749964, "learning_rate": 0.0001, "loss": 0.0018, "step": 800 }, { "epoch": 1.4794520547945205, "grad_norm": 0.004175902344286442, "learning_rate": 0.0001, "loss": 0.0017, "step": 810 }, { "epoch": 1.4977168949771689, "grad_norm": 0.005314885172992945, "learning_rate": 0.0001, "loss": 0.0019, "step": 820 }, { "epoch": 1.5159817351598175, "grad_norm": 0.004691184964030981, "learning_rate": 0.0001, "loss": 0.0018, "step": 830 }, { "epoch": 1.5342465753424657, "grad_norm": 0.006277224514633417, "learning_rate": 0.0001, "loss": 0.0018, "step": 840 }, { "epoch": 1.5525114155251143, "grad_norm": 0.004492647014558315, "learning_rate": 0.0001, "loss": 0.0017, "step": 850 }, { "epoch": 1.5707762557077625, "grad_norm": 0.00427781417965889, "learning_rate": 0.0001, "loss": 0.0017, "step": 860 }, { "epoch": 1.589041095890411, "grad_norm": 0.005225111730396748, "learning_rate": 0.0001, "loss": 0.0019, "step": 870 }, { "epoch": 1.6073059360730593, "grad_norm": 0.004722876939922571, "learning_rate": 0.0001, "loss": 0.0019, "step": 880 }, { "epoch": 1.625570776255708, "grad_norm": 0.0056340452283620834, "learning_rate": 0.0001, "loss": 0.0019, "step": 890 }, { "epoch": 1.643835616438356, "grad_norm": 0.004999073222279549, "learning_rate": 0.0001, "loss": 0.0018, "step": 900 }, { "epoch": 1.6621004566210047, "grad_norm": 0.005323594436049461, "learning_rate": 0.0001, "loss": 0.0018, "step": 910 }, { "epoch": 1.6803652968036529, "grad_norm": 0.006069580093026161, "learning_rate": 0.0001, "loss": 0.0018, "step": 920 }, { "epoch": 1.6986301369863015, "grad_norm": 0.006003932561725378, "learning_rate": 0.0001, "loss": 0.0017, "step": 930 }, { "epoch": 1.7168949771689497, "grad_norm": 0.005637574940919876, "learning_rate": 0.0001, "loss": 0.0017, "step": 940 }, { "epoch": 1.7351598173515983, "grad_norm": 0.004971097223460674, "learning_rate": 0.0001, "loss": 0.0017, "step": 950 }, { "epoch": 1.7534246575342465, "grad_norm": 0.005295970477163792, "learning_rate": 0.0001, "loss": 0.0017, "step": 960 }, { "epoch": 1.771689497716895, "grad_norm": 0.0048394943587481976, "learning_rate": 0.0001, "loss": 0.0017, "step": 970 }, { "epoch": 1.7899543378995433, "grad_norm": 0.005681538488715887, "learning_rate": 0.0001, "loss": 0.0017, "step": 980 }, { "epoch": 1.808219178082192, "grad_norm": 0.007275606505572796, "learning_rate": 0.0001, "loss": 0.0018, "step": 990 }, { "epoch": 1.82648401826484, "grad_norm": 0.004521261900663376, "learning_rate": 0.0001, "loss": 0.0016, "step": 1000 }, { "epoch": 1.82648401826484, "step": 1000, "total_flos": 5.565784553370419e+18, "train_loss": 0.04975467654503882, "train_runtime": 15752.6954, "train_samples_per_second": 10.157, "train_steps_per_second": 0.063 } ], "logging_steps": 10, "max_steps": 1000, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.565784553370419e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }