{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08691752445222739, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00042711314227138767, "grad_norm": 0.6801537275314331, "learning_rate": 2.910112359550562e-06, "loss": 0.6308, "step": 10 }, { "epoch": 0.0008542262845427753, "grad_norm": 0.7330222725868225, "learning_rate": 3.921348314606742e-06, "loss": 0.5921, "step": 20 }, { "epoch": 0.001281339426814163, "grad_norm": 0.7190220952033997, "learning_rate": 4.932584269662922e-06, "loss": 0.6197, "step": 30 }, { "epoch": 0.0017084525690855507, "grad_norm": 0.6695777773857117, "learning_rate": 5.943820224719102e-06, "loss": 0.6225, "step": 40 }, { "epoch": 0.0021355657113569385, "grad_norm": 0.7244643568992615, "learning_rate": 6.955056179775282e-06, "loss": 0.5868, "step": 50 }, { "epoch": 0.002562678853628326, "grad_norm": 0.7338688373565674, "learning_rate": 7.966292134831462e-06, "loss": 0.602, "step": 60 }, { "epoch": 0.0029897919958997137, "grad_norm": 0.7063023447990417, "learning_rate": 8.977528089887641e-06, "loss": 0.5962, "step": 70 }, { "epoch": 0.0034169051381711013, "grad_norm": 0.7280859351158142, "learning_rate": 9.988764044943822e-06, "loss": 0.5849, "step": 80 }, { "epoch": 0.0038440182804424894, "grad_norm": 0.6686920523643494, "learning_rate": 1.1000000000000001e-05, "loss": 0.5945, "step": 90 }, { "epoch": 0.004271131422713877, "grad_norm": 0.6424954533576965, "learning_rate": 1.2011235955056182e-05, "loss": 0.5742, "step": 100 }, { "epoch": 0.004698244564985265, "grad_norm": 0.7504611015319824, "learning_rate": 1.3022471910112362e-05, "loss": 0.6183, "step": 110 }, { "epoch": 0.005125357707256652, "grad_norm": 0.7265036106109619, "learning_rate": 1.403370786516854e-05, "loss": 0.6288, "step": 120 }, { "epoch": 0.00555247084952804, "grad_norm": 0.6728747487068176, "learning_rate": 1.504494382022472e-05, "loss": 0.5932, "step": 130 }, { "epoch": 0.005979583991799427, "grad_norm": 0.5877931118011475, "learning_rate": 1.60561797752809e-05, "loss": 0.6073, "step": 140 }, { "epoch": 0.0064066971340708155, "grad_norm": 0.9119960069656372, "learning_rate": 1.706741573033708e-05, "loss": 0.594, "step": 150 }, { "epoch": 0.006833810276342203, "grad_norm": 0.6038461327552795, "learning_rate": 1.8078651685393256e-05, "loss": 0.6186, "step": 160 }, { "epoch": 0.007260923418613591, "grad_norm": 0.6067227125167847, "learning_rate": 1.908988764044944e-05, "loss": 0.608, "step": 170 }, { "epoch": 0.007688036560884979, "grad_norm": 0.6028957962989807, "learning_rate": 2e-05, "loss": 0.5816, "step": 180 }, { "epoch": 0.008115149703156367, "grad_norm": 0.5894806385040283, "learning_rate": 2e-05, "loss": 0.604, "step": 190 }, { "epoch": 0.008542262845427754, "grad_norm": 0.5551896691322327, "learning_rate": 2e-05, "loss": 0.6181, "step": 200 }, { "epoch": 0.008969375987699141, "grad_norm": 0.48914626240730286, "learning_rate": 2e-05, "loss": 0.6003, "step": 210 }, { "epoch": 0.00939648912997053, "grad_norm": 0.5296058058738708, "learning_rate": 2e-05, "loss": 0.6201, "step": 220 }, { "epoch": 0.009823602272241917, "grad_norm": 0.7409117221832275, "learning_rate": 2e-05, "loss": 0.5938, "step": 230 }, { "epoch": 0.010250715414513304, "grad_norm": 0.5655877590179443, "learning_rate": 2e-05, "loss": 0.5714, "step": 240 }, { "epoch": 0.010677828556784692, "grad_norm": 0.4660634696483612, "learning_rate": 2e-05, "loss": 0.5736, "step": 250 }, { "epoch": 0.01110494169905608, "grad_norm": 0.437298059463501, "learning_rate": 2e-05, "loss": 0.5944, "step": 260 }, { "epoch": 0.011532054841327468, "grad_norm": 0.7993448376655579, "learning_rate": 2e-05, "loss": 0.5918, "step": 270 }, { "epoch": 0.011959167983598855, "grad_norm": 0.46986427903175354, "learning_rate": 2e-05, "loss": 0.6001, "step": 280 }, { "epoch": 0.012386281125870244, "grad_norm": 0.4165823459625244, "learning_rate": 2e-05, "loss": 0.5817, "step": 290 }, { "epoch": 0.012813394268141631, "grad_norm": 0.4695897102355957, "learning_rate": 2e-05, "loss": 0.5949, "step": 300 }, { "epoch": 0.013240507410413018, "grad_norm": 0.46940892934799194, "learning_rate": 2e-05, "loss": 0.6293, "step": 310 }, { "epoch": 0.013667620552684405, "grad_norm": 0.37120378017425537, "learning_rate": 2e-05, "loss": 0.6057, "step": 320 }, { "epoch": 0.014094733694955794, "grad_norm": 0.4567081928253174, "learning_rate": 2e-05, "loss": 0.6088, "step": 330 }, { "epoch": 0.014521846837227181, "grad_norm": 0.5053907036781311, "learning_rate": 2e-05, "loss": 0.575, "step": 340 }, { "epoch": 0.014948959979498569, "grad_norm": 0.4822077453136444, "learning_rate": 2e-05, "loss": 0.6305, "step": 350 }, { "epoch": 0.015376073121769957, "grad_norm": 0.42418718338012695, "learning_rate": 2e-05, "loss": 0.609, "step": 360 }, { "epoch": 0.015803186264041345, "grad_norm": 0.4470791816711426, "learning_rate": 2e-05, "loss": 0.609, "step": 370 }, { "epoch": 0.016230299406312734, "grad_norm": 0.4747907221317291, "learning_rate": 2e-05, "loss": 0.5753, "step": 380 }, { "epoch": 0.01665741254858412, "grad_norm": 0.429513156414032, "learning_rate": 2e-05, "loss": 0.5757, "step": 390 }, { "epoch": 0.017084525690855508, "grad_norm": 1.1115094423294067, "learning_rate": 2e-05, "loss": 0.5973, "step": 400 }, { "epoch": 0.017511638833126897, "grad_norm": 0.4465528130531311, "learning_rate": 2e-05, "loss": 0.6135, "step": 410 }, { "epoch": 0.017938751975398282, "grad_norm": 0.45542335510253906, "learning_rate": 2e-05, "loss": 0.5925, "step": 420 }, { "epoch": 0.01836586511766967, "grad_norm": 0.4971701204776764, "learning_rate": 2e-05, "loss": 0.6015, "step": 430 }, { "epoch": 0.01879297825994106, "grad_norm": 0.4876435101032257, "learning_rate": 2e-05, "loss": 0.612, "step": 440 }, { "epoch": 0.019220091402212446, "grad_norm": 0.4507445693016052, "learning_rate": 2e-05, "loss": 0.6096, "step": 450 }, { "epoch": 0.019647204544483834, "grad_norm": 0.48777464032173157, "learning_rate": 2e-05, "loss": 0.5804, "step": 460 }, { "epoch": 0.02007431768675522, "grad_norm": 0.42354583740234375, "learning_rate": 2e-05, "loss": 0.6102, "step": 470 }, { "epoch": 0.02050143082902661, "grad_norm": 0.4695739448070526, "learning_rate": 2e-05, "loss": 0.6343, "step": 480 }, { "epoch": 0.020928543971297998, "grad_norm": 0.4769243896007538, "learning_rate": 2e-05, "loss": 0.5989, "step": 490 }, { "epoch": 0.021355657113569383, "grad_norm": 0.44087329506874084, "learning_rate": 2e-05, "loss": 0.5978, "step": 500 }, { "epoch": 0.021782770255840772, "grad_norm": 0.42501866817474365, "learning_rate": 2e-05, "loss": 0.6133, "step": 510 }, { "epoch": 0.02220988339811216, "grad_norm": 0.38661816716194153, "learning_rate": 2e-05, "loss": 0.6056, "step": 520 }, { "epoch": 0.022636996540383546, "grad_norm": 0.43126940727233887, "learning_rate": 2e-05, "loss": 0.5679, "step": 530 }, { "epoch": 0.023064109682654935, "grad_norm": 0.433454304933548, "learning_rate": 2e-05, "loss": 0.6074, "step": 540 }, { "epoch": 0.023491222824926324, "grad_norm": 0.3950791656970978, "learning_rate": 2e-05, "loss": 0.6267, "step": 550 }, { "epoch": 0.02391833596719771, "grad_norm": 0.42388349771499634, "learning_rate": 2e-05, "loss": 0.6457, "step": 560 }, { "epoch": 0.0243454491094691, "grad_norm": 0.4391220510005951, "learning_rate": 2e-05, "loss": 0.6222, "step": 570 }, { "epoch": 0.024772562251740488, "grad_norm": 0.4486788213253021, "learning_rate": 2e-05, "loss": 0.6232, "step": 580 }, { "epoch": 0.025199675394011873, "grad_norm": 0.5258558988571167, "learning_rate": 2e-05, "loss": 0.6157, "step": 590 }, { "epoch": 0.025626788536283262, "grad_norm": 0.3985844552516937, "learning_rate": 2e-05, "loss": 0.5623, "step": 600 }, { "epoch": 0.02605390167855465, "grad_norm": 0.4276188910007477, "learning_rate": 2e-05, "loss": 0.589, "step": 610 }, { "epoch": 0.026481014820826036, "grad_norm": 0.36040425300598145, "learning_rate": 2e-05, "loss": 0.5889, "step": 620 }, { "epoch": 0.026908127963097425, "grad_norm": 0.43689343333244324, "learning_rate": 2e-05, "loss": 0.586, "step": 630 }, { "epoch": 0.02733524110536881, "grad_norm": 0.38051506876945496, "learning_rate": 2e-05, "loss": 0.6155, "step": 640 }, { "epoch": 0.0277623542476402, "grad_norm": 0.375367134809494, "learning_rate": 2e-05, "loss": 0.6267, "step": 650 }, { "epoch": 0.02818946738991159, "grad_norm": 0.40035131573677063, "learning_rate": 2e-05, "loss": 0.6035, "step": 660 }, { "epoch": 0.028616580532182974, "grad_norm": 0.429284006357193, "learning_rate": 2e-05, "loss": 0.5957, "step": 670 }, { "epoch": 0.029043693674454363, "grad_norm": 0.4076769948005676, "learning_rate": 2e-05, "loss": 0.599, "step": 680 }, { "epoch": 0.02947080681672575, "grad_norm": 0.39563876390457153, "learning_rate": 2e-05, "loss": 0.5906, "step": 690 }, { "epoch": 0.029897919958997137, "grad_norm": 0.39621901512145996, "learning_rate": 2e-05, "loss": 0.615, "step": 700 }, { "epoch": 0.030325033101268526, "grad_norm": 0.43017053604125977, "learning_rate": 2e-05, "loss": 0.6114, "step": 710 }, { "epoch": 0.030752146243539915, "grad_norm": 0.3699895143508911, "learning_rate": 2e-05, "loss": 0.6024, "step": 720 }, { "epoch": 0.0311792593858113, "grad_norm": 0.39387860894203186, "learning_rate": 2e-05, "loss": 0.5797, "step": 730 }, { "epoch": 0.03160637252808269, "grad_norm": 0.36330047249794006, "learning_rate": 2e-05, "loss": 0.5641, "step": 740 }, { "epoch": 0.03203348567035408, "grad_norm": 0.3734346628189087, "learning_rate": 2e-05, "loss": 0.6066, "step": 750 }, { "epoch": 0.03246059881262547, "grad_norm": 0.3981451690196991, "learning_rate": 2e-05, "loss": 0.5708, "step": 760 }, { "epoch": 0.03288771195489685, "grad_norm": 0.5013331770896912, "learning_rate": 2e-05, "loss": 0.5786, "step": 770 }, { "epoch": 0.03331482509716824, "grad_norm": 0.4515092968940735, "learning_rate": 2e-05, "loss": 0.6274, "step": 780 }, { "epoch": 0.03374193823943963, "grad_norm": 0.4270780682563782, "learning_rate": 2e-05, "loss": 0.6274, "step": 790 }, { "epoch": 0.034169051381711016, "grad_norm": 0.40977057814598083, "learning_rate": 2e-05, "loss": 0.5903, "step": 800 }, { "epoch": 0.034596164523982405, "grad_norm": 0.3862808644771576, "learning_rate": 2e-05, "loss": 0.591, "step": 810 }, { "epoch": 0.035023277666253794, "grad_norm": 0.3566862642765045, "learning_rate": 2e-05, "loss": 0.5822, "step": 820 }, { "epoch": 0.035450390808525176, "grad_norm": 0.47487324476242065, "learning_rate": 2e-05, "loss": 0.6037, "step": 830 }, { "epoch": 0.035877503950796565, "grad_norm": 0.6204171180725098, "learning_rate": 2e-05, "loss": 0.606, "step": 840 }, { "epoch": 0.036304617093067953, "grad_norm": 0.38122642040252686, "learning_rate": 2e-05, "loss": 0.6022, "step": 850 }, { "epoch": 0.03673173023533934, "grad_norm": 0.45812979340553284, "learning_rate": 2e-05, "loss": 0.6134, "step": 860 }, { "epoch": 0.03715884337761073, "grad_norm": 0.38281163573265076, "learning_rate": 2e-05, "loss": 0.5692, "step": 870 }, { "epoch": 0.03758595651988212, "grad_norm": 0.44842684268951416, "learning_rate": 2e-05, "loss": 0.6195, "step": 880 }, { "epoch": 0.0380130696621535, "grad_norm": 0.3978036642074585, "learning_rate": 2e-05, "loss": 0.5872, "step": 890 }, { "epoch": 0.03844018280442489, "grad_norm": 0.40599605441093445, "learning_rate": 2e-05, "loss": 0.5896, "step": 900 }, { "epoch": 0.03886729594669628, "grad_norm": 0.4849986732006073, "learning_rate": 2e-05, "loss": 0.5679, "step": 910 }, { "epoch": 0.03929440908896767, "grad_norm": 0.3729165196418762, "learning_rate": 2e-05, "loss": 0.5941, "step": 920 }, { "epoch": 0.03972152223123906, "grad_norm": 0.3839932680130005, "learning_rate": 2e-05, "loss": 0.5809, "step": 930 }, { "epoch": 0.04014863537351044, "grad_norm": 0.3133138120174408, "learning_rate": 2e-05, "loss": 0.5909, "step": 940 }, { "epoch": 0.04057574851578183, "grad_norm": 0.37946876883506775, "learning_rate": 2e-05, "loss": 0.5791, "step": 950 }, { "epoch": 0.04100286165805322, "grad_norm": 0.3639635741710663, "learning_rate": 2e-05, "loss": 0.6028, "step": 960 }, { "epoch": 0.04142997480032461, "grad_norm": 0.39474979043006897, "learning_rate": 2e-05, "loss": 0.5927, "step": 970 }, { "epoch": 0.041857087942595995, "grad_norm": 0.39630550146102905, "learning_rate": 2e-05, "loss": 0.5861, "step": 980 }, { "epoch": 0.042284201084867384, "grad_norm": 0.4038623571395874, "learning_rate": 2e-05, "loss": 0.5991, "step": 990 }, { "epoch": 0.042711314227138766, "grad_norm": 0.46558162569999695, "learning_rate": 2e-05, "loss": 0.5842, "step": 1000 }, { "epoch": 0.043138427369410155, "grad_norm": 0.4309065043926239, "learning_rate": 2e-05, "loss": 0.6021, "step": 1010 }, { "epoch": 0.043565540511681544, "grad_norm": 0.3698565363883972, "learning_rate": 2e-05, "loss": 0.607, "step": 1020 }, { "epoch": 0.04399265365395293, "grad_norm": 0.40514087677001953, "learning_rate": 2e-05, "loss": 0.5933, "step": 1030 }, { "epoch": 0.04441976679622432, "grad_norm": 0.7474258542060852, "learning_rate": 2e-05, "loss": 0.5946, "step": 1040 }, { "epoch": 0.04484687993849571, "grad_norm": 0.38786014914512634, "learning_rate": 2e-05, "loss": 0.6132, "step": 1050 }, { "epoch": 0.04527399308076709, "grad_norm": 0.38152816891670227, "learning_rate": 2e-05, "loss": 0.5799, "step": 1060 }, { "epoch": 0.04570110622303848, "grad_norm": 0.5136268734931946, "learning_rate": 2e-05, "loss": 0.6335, "step": 1070 }, { "epoch": 0.04612821936530987, "grad_norm": 0.37756872177124023, "learning_rate": 2e-05, "loss": 0.5794, "step": 1080 }, { "epoch": 0.04655533250758126, "grad_norm": 0.41157087683677673, "learning_rate": 2e-05, "loss": 0.6129, "step": 1090 }, { "epoch": 0.04698244564985265, "grad_norm": 0.45449504256248474, "learning_rate": 2e-05, "loss": 0.6074, "step": 1100 }, { "epoch": 0.04740955879212403, "grad_norm": 0.36440810561180115, "learning_rate": 2e-05, "loss": 0.5905, "step": 1110 }, { "epoch": 0.04783667193439542, "grad_norm": 0.40203210711479187, "learning_rate": 2e-05, "loss": 0.5772, "step": 1120 }, { "epoch": 0.04826378507666681, "grad_norm": 0.4374965727329254, "learning_rate": 2e-05, "loss": 0.6033, "step": 1130 }, { "epoch": 0.0486908982189382, "grad_norm": 0.37814727425575256, "learning_rate": 2e-05, "loss": 0.6051, "step": 1140 }, { "epoch": 0.049118011361209586, "grad_norm": 0.3608170449733734, "learning_rate": 2e-05, "loss": 0.6036, "step": 1150 }, { "epoch": 0.049545124503480975, "grad_norm": 0.5163088440895081, "learning_rate": 2e-05, "loss": 0.5888, "step": 1160 }, { "epoch": 0.04997223764575236, "grad_norm": 0.6338587403297424, "learning_rate": 2e-05, "loss": 0.5846, "step": 1170 }, { "epoch": 0.050399350788023746, "grad_norm": 0.3570212125778198, "learning_rate": 2e-05, "loss": 0.5997, "step": 1180 }, { "epoch": 0.050826463930295135, "grad_norm": 0.4730677604675293, "learning_rate": 2e-05, "loss": 0.5666, "step": 1190 }, { "epoch": 0.051253577072566524, "grad_norm": 0.4634343683719635, "learning_rate": 2e-05, "loss": 0.6167, "step": 1200 }, { "epoch": 0.05168069021483791, "grad_norm": 0.4279061555862427, "learning_rate": 2e-05, "loss": 0.5984, "step": 1210 }, { "epoch": 0.0521078033571093, "grad_norm": 0.42280420660972595, "learning_rate": 2e-05, "loss": 0.5715, "step": 1220 }, { "epoch": 0.052534916499380684, "grad_norm": 0.34051749110221863, "learning_rate": 2e-05, "loss": 0.577, "step": 1230 }, { "epoch": 0.05296202964165207, "grad_norm": 0.3963359296321869, "learning_rate": 2e-05, "loss": 0.6313, "step": 1240 }, { "epoch": 0.05338914278392346, "grad_norm": 0.5236133933067322, "learning_rate": 2e-05, "loss": 0.6187, "step": 1250 }, { "epoch": 0.05381625592619485, "grad_norm": 0.40057671070098877, "learning_rate": 2e-05, "loss": 0.6118, "step": 1260 }, { "epoch": 0.05424336906846624, "grad_norm": 0.4331953227519989, "learning_rate": 2e-05, "loss": 0.5933, "step": 1270 }, { "epoch": 0.05467048221073762, "grad_norm": 0.35897260904312134, "learning_rate": 2e-05, "loss": 0.5776, "step": 1280 }, { "epoch": 0.05509759535300901, "grad_norm": 0.40010058879852295, "learning_rate": 2e-05, "loss": 0.58, "step": 1290 }, { "epoch": 0.0555247084952804, "grad_norm": 0.49022912979125977, "learning_rate": 2e-05, "loss": 0.5747, "step": 1300 }, { "epoch": 0.05595182163755179, "grad_norm": 0.4582119584083557, "learning_rate": 2e-05, "loss": 0.5994, "step": 1310 }, { "epoch": 0.05637893477982318, "grad_norm": 0.4133841097354889, "learning_rate": 2e-05, "loss": 0.5856, "step": 1320 }, { "epoch": 0.056806047922094566, "grad_norm": 0.40341418981552124, "learning_rate": 2e-05, "loss": 0.615, "step": 1330 }, { "epoch": 0.05723316106436595, "grad_norm": 0.3729898929595947, "learning_rate": 2e-05, "loss": 0.5871, "step": 1340 }, { "epoch": 0.05766027420663734, "grad_norm": 0.36487877368927, "learning_rate": 2e-05, "loss": 0.6087, "step": 1350 }, { "epoch": 0.058087387348908726, "grad_norm": 0.410173237323761, "learning_rate": 2e-05, "loss": 0.6106, "step": 1360 }, { "epoch": 0.058514500491180114, "grad_norm": 0.4052298367023468, "learning_rate": 2e-05, "loss": 0.5794, "step": 1370 }, { "epoch": 0.0589416136334515, "grad_norm": 0.35845524072647095, "learning_rate": 2e-05, "loss": 0.5818, "step": 1380 }, { "epoch": 0.05936872677572289, "grad_norm": 0.39520588517189026, "learning_rate": 2e-05, "loss": 0.5724, "step": 1390 }, { "epoch": 0.059795839917994274, "grad_norm": 0.3926452696323395, "learning_rate": 2e-05, "loss": 0.5787, "step": 1400 }, { "epoch": 0.06022295306026566, "grad_norm": 0.3984834551811218, "learning_rate": 2e-05, "loss": 0.6149, "step": 1410 }, { "epoch": 0.06065006620253705, "grad_norm": 0.4060869514942169, "learning_rate": 2e-05, "loss": 0.623, "step": 1420 }, { "epoch": 0.06107717934480844, "grad_norm": 0.3899109661579132, "learning_rate": 2e-05, "loss": 0.606, "step": 1430 }, { "epoch": 0.06150429248707983, "grad_norm": 0.41343048214912415, "learning_rate": 2e-05, "loss": 0.62, "step": 1440 }, { "epoch": 0.06193140562935121, "grad_norm": 0.5486384630203247, "learning_rate": 2e-05, "loss": 0.5888, "step": 1450 }, { "epoch": 0.0623585187716226, "grad_norm": 0.4260222017765045, "learning_rate": 2e-05, "loss": 0.5949, "step": 1460 }, { "epoch": 0.062785631913894, "grad_norm": 0.5510641932487488, "learning_rate": 2e-05, "loss": 0.5917, "step": 1470 }, { "epoch": 0.06321274505616538, "grad_norm": 0.3307860791683197, "learning_rate": 2e-05, "loss": 0.5966, "step": 1480 }, { "epoch": 0.06363985819843676, "grad_norm": 0.37774041295051575, "learning_rate": 2e-05, "loss": 0.5928, "step": 1490 }, { "epoch": 0.06406697134070816, "grad_norm": 0.40287962555885315, "learning_rate": 2e-05, "loss": 0.6018, "step": 1500 }, { "epoch": 0.06449408448297954, "grad_norm": 0.3765062987804413, "learning_rate": 2e-05, "loss": 0.5868, "step": 1510 }, { "epoch": 0.06492119762525093, "grad_norm": 0.3866639733314514, "learning_rate": 2e-05, "loss": 0.5918, "step": 1520 }, { "epoch": 0.06534831076752232, "grad_norm": 0.3452185392379761, "learning_rate": 2e-05, "loss": 0.6006, "step": 1530 }, { "epoch": 0.0657754239097937, "grad_norm": 0.3757578730583191, "learning_rate": 2e-05, "loss": 0.5885, "step": 1540 }, { "epoch": 0.0662025370520651, "grad_norm": 0.6169503927230835, "learning_rate": 2e-05, "loss": 0.5942, "step": 1550 }, { "epoch": 0.06662965019433648, "grad_norm": 0.40690863132476807, "learning_rate": 2e-05, "loss": 0.5846, "step": 1560 }, { "epoch": 0.06705676333660787, "grad_norm": 0.40239500999450684, "learning_rate": 2e-05, "loss": 0.6043, "step": 1570 }, { "epoch": 0.06748387647887925, "grad_norm": 0.6150453090667725, "learning_rate": 2e-05, "loss": 0.5687, "step": 1580 }, { "epoch": 0.06791098962115065, "grad_norm": 0.3692316710948944, "learning_rate": 2e-05, "loss": 0.5934, "step": 1590 }, { "epoch": 0.06833810276342203, "grad_norm": 0.4124865233898163, "learning_rate": 2e-05, "loss": 0.5784, "step": 1600 }, { "epoch": 0.06876521590569341, "grad_norm": 0.40603578090667725, "learning_rate": 2e-05, "loss": 0.5536, "step": 1610 }, { "epoch": 0.06919232904796481, "grad_norm": 0.3672163188457489, "learning_rate": 2e-05, "loss": 0.5949, "step": 1620 }, { "epoch": 0.06961944219023619, "grad_norm": 0.4111248850822449, "learning_rate": 2e-05, "loss": 0.6168, "step": 1630 }, { "epoch": 0.07004655533250759, "grad_norm": 0.3349396288394928, "learning_rate": 2e-05, "loss": 0.6096, "step": 1640 }, { "epoch": 0.07047366847477897, "grad_norm": 0.35192081332206726, "learning_rate": 2e-05, "loss": 0.6309, "step": 1650 }, { "epoch": 0.07090078161705035, "grad_norm": 0.46462368965148926, "learning_rate": 2e-05, "loss": 0.5827, "step": 1660 }, { "epoch": 0.07132789475932175, "grad_norm": 0.4099385440349579, "learning_rate": 2e-05, "loss": 0.6093, "step": 1670 }, { "epoch": 0.07175500790159313, "grad_norm": 0.39262962341308594, "learning_rate": 2e-05, "loss": 0.5959, "step": 1680 }, { "epoch": 0.07218212104386452, "grad_norm": 0.4145928919315338, "learning_rate": 2e-05, "loss": 0.5776, "step": 1690 }, { "epoch": 0.07260923418613591, "grad_norm": 0.33485323190689087, "learning_rate": 2e-05, "loss": 0.5864, "step": 1700 }, { "epoch": 0.07303634732840729, "grad_norm": 0.3448295295238495, "learning_rate": 2e-05, "loss": 0.6077, "step": 1710 }, { "epoch": 0.07346346047067868, "grad_norm": 0.3951145112514496, "learning_rate": 2e-05, "loss": 0.5667, "step": 1720 }, { "epoch": 0.07389057361295007, "grad_norm": 0.36090508103370667, "learning_rate": 2e-05, "loss": 0.6006, "step": 1730 }, { "epoch": 0.07431768675522146, "grad_norm": 0.35783612728118896, "learning_rate": 2e-05, "loss": 0.5698, "step": 1740 }, { "epoch": 0.07474479989749284, "grad_norm": 0.4051808714866638, "learning_rate": 2e-05, "loss": 0.5841, "step": 1750 }, { "epoch": 0.07517191303976424, "grad_norm": 0.36852049827575684, "learning_rate": 2e-05, "loss": 0.5812, "step": 1760 }, { "epoch": 0.07559902618203562, "grad_norm": 0.47315099835395813, "learning_rate": 2e-05, "loss": 0.5867, "step": 1770 }, { "epoch": 0.076026139324307, "grad_norm": 0.370299756526947, "learning_rate": 2e-05, "loss": 0.5944, "step": 1780 }, { "epoch": 0.0764532524665784, "grad_norm": 0.3629041314125061, "learning_rate": 2e-05, "loss": 0.5895, "step": 1790 }, { "epoch": 0.07688036560884978, "grad_norm": 0.4631352722644806, "learning_rate": 2e-05, "loss": 0.6233, "step": 1800 }, { "epoch": 0.07730747875112118, "grad_norm": 0.3893195390701294, "learning_rate": 2e-05, "loss": 0.579, "step": 1810 }, { "epoch": 0.07773459189339256, "grad_norm": 0.4197307825088501, "learning_rate": 2e-05, "loss": 0.6022, "step": 1820 }, { "epoch": 0.07816170503566394, "grad_norm": 0.5316178798675537, "learning_rate": 2e-05, "loss": 0.6127, "step": 1830 }, { "epoch": 0.07858881817793534, "grad_norm": 0.4087827801704407, "learning_rate": 2e-05, "loss": 0.6148, "step": 1840 }, { "epoch": 0.07901593132020672, "grad_norm": 0.9132181406021118, "learning_rate": 2e-05, "loss": 0.5675, "step": 1850 }, { "epoch": 0.07944304446247812, "grad_norm": 0.42939144372940063, "learning_rate": 2e-05, "loss": 0.5827, "step": 1860 }, { "epoch": 0.0798701576047495, "grad_norm": 0.5866528749465942, "learning_rate": 2e-05, "loss": 0.5984, "step": 1870 }, { "epoch": 0.08029727074702088, "grad_norm": 0.38625794649124146, "learning_rate": 2e-05, "loss": 0.5712, "step": 1880 }, { "epoch": 0.08072438388929228, "grad_norm": 0.3775944411754608, "learning_rate": 2e-05, "loss": 0.5633, "step": 1890 }, { "epoch": 0.08115149703156366, "grad_norm": 0.37404197454452515, "learning_rate": 2e-05, "loss": 0.5944, "step": 1900 }, { "epoch": 0.08157861017383505, "grad_norm": 0.4127039611339569, "learning_rate": 2e-05, "loss": 0.5685, "step": 1910 }, { "epoch": 0.08200572331610644, "grad_norm": 0.4228227734565735, "learning_rate": 2e-05, "loss": 0.5907, "step": 1920 }, { "epoch": 0.08243283645837783, "grad_norm": 0.3642731010913849, "learning_rate": 2e-05, "loss": 0.5926, "step": 1930 }, { "epoch": 0.08285994960064921, "grad_norm": 0.3753544092178345, "learning_rate": 2e-05, "loss": 0.598, "step": 1940 }, { "epoch": 0.0832870627429206, "grad_norm": 0.35891029238700867, "learning_rate": 2e-05, "loss": 0.5862, "step": 1950 }, { "epoch": 0.08371417588519199, "grad_norm": 0.3859628438949585, "learning_rate": 2e-05, "loss": 0.5787, "step": 1960 }, { "epoch": 0.08414128902746337, "grad_norm": 0.3352157473564148, "learning_rate": 2e-05, "loss": 0.5677, "step": 1970 }, { "epoch": 0.08456840216973477, "grad_norm": 0.38465848565101624, "learning_rate": 2e-05, "loss": 0.5651, "step": 1980 }, { "epoch": 0.08499551531200615, "grad_norm": 0.8394455313682556, "learning_rate": 2e-05, "loss": 0.5683, "step": 1990 }, { "epoch": 0.08542262845427753, "grad_norm": 0.39962485432624817, "learning_rate": 2e-05, "loss": 0.5793, "step": 2000 }, { "epoch": 0.08584974159654893, "grad_norm": 0.3594360649585724, "learning_rate": 2e-05, "loss": 0.6158, "step": 2010 }, { "epoch": 0.08627685473882031, "grad_norm": 0.388683557510376, "learning_rate": 2e-05, "loss": 0.5829, "step": 2020 }, { "epoch": 0.0867039678810917, "grad_norm": 0.33351218700408936, "learning_rate": 2e-05, "loss": 0.5698, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.084295122442519e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }