{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06519719347707686, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003203793291256848, "grad_norm": 2697.9695951365356, "learning_rate": 2.910112359550562e-06, "loss": 2.1080955505371093, "step": 10 }, { "epoch": 0.0006407586582513696, "grad_norm": 150.28792394404246, "learning_rate": 3.921348314606742e-06, "loss": 1.051735782623291, "step": 20 }, { "epoch": 0.0009611379873770544, "grad_norm": 11.728004906904669, "learning_rate": 4.932584269662922e-06, "loss": 0.8452852249145508, "step": 30 }, { "epoch": 0.0012815173165027392, "grad_norm": 79.82045143025138, "learning_rate": 5.943820224719102e-06, "loss": 0.8374807357788085, "step": 40 }, { "epoch": 0.001601896645628424, "grad_norm": 15.487828868814473, "learning_rate": 6.955056179775282e-06, "loss": 0.8031275749206543, "step": 50 }, { "epoch": 0.0019222759747541088, "grad_norm": 26.189373840069653, "learning_rate": 7.966292134831462e-06, "loss": 0.7619327545166016, "step": 60 }, { "epoch": 0.002242655303879794, "grad_norm": 24.510054444181353, "learning_rate": 8.977528089887641e-06, "loss": 0.788119888305664, "step": 70 }, { "epoch": 0.0025630346330054784, "grad_norm": 27.619677813912134, "learning_rate": 9.988764044943822e-06, "loss": 0.8074554443359375, "step": 80 }, { "epoch": 0.0028834139621311634, "grad_norm": 53.27561070809039, "learning_rate": 1.1000000000000001e-05, "loss": 0.7780509948730469, "step": 90 }, { "epoch": 0.003203793291256848, "grad_norm": 20.22293994140261, "learning_rate": 1.2011235955056182e-05, "loss": 0.7639347076416015, "step": 100 }, { "epoch": 0.003524172620382533, "grad_norm": 28.55291130912943, "learning_rate": 1.3022471910112362e-05, "loss": 0.7700469970703125, "step": 110 }, { "epoch": 0.0038445519495082176, "grad_norm": 7.520305767933223, "learning_rate": 1.403370786516854e-05, "loss": 0.7953043937683105, "step": 120 }, { "epoch": 0.004164931278633903, "grad_norm": 96.08078842951305, "learning_rate": 1.504494382022472e-05, "loss": 0.8506025314331055, "step": 130 }, { "epoch": 0.004485310607759588, "grad_norm": 948.131373093307, "learning_rate": 1.60561797752809e-05, "loss": 0.8122509002685547, "step": 140 }, { "epoch": 0.004805689936885272, "grad_norm": 128.55037969805156, "learning_rate": 1.706741573033708e-05, "loss": 0.7938695907592773, "step": 150 }, { "epoch": 0.005126069266010957, "grad_norm": 25.93618158094234, "learning_rate": 1.8078651685393256e-05, "loss": 0.8438175201416016, "step": 160 }, { "epoch": 0.005446448595136642, "grad_norm": 9.528266971779534, "learning_rate": 1.908988764044944e-05, "loss": 0.9011789321899414, "step": 170 }, { "epoch": 0.005766827924262327, "grad_norm": 4.6353029582495315, "learning_rate": 2e-05, "loss": 0.8190475463867187, "step": 180 }, { "epoch": 0.006087207253388012, "grad_norm": 7.804600561994388, "learning_rate": 2e-05, "loss": 0.7879319667816163, "step": 190 }, { "epoch": 0.006407586582513696, "grad_norm": 8.759193053432988, "learning_rate": 2e-05, "loss": 0.8373113632202148, "step": 200 }, { "epoch": 0.006727965911639381, "grad_norm": 5.7645630188571495, "learning_rate": 2e-05, "loss": 0.8225456237792969, "step": 210 }, { "epoch": 0.007048345240765066, "grad_norm": 2.975476645382291, "learning_rate": 2e-05, "loss": 0.7898527145385742, "step": 220 }, { "epoch": 0.007368724569890751, "grad_norm": 3.5660713690110923, "learning_rate": 2e-05, "loss": 0.7848415374755859, "step": 230 }, { "epoch": 0.007689103899016435, "grad_norm": 3.776542520178389, "learning_rate": 2e-05, "loss": 0.7830493927001954, "step": 240 }, { "epoch": 0.008009483228142121, "grad_norm": 5.652886706438173, "learning_rate": 2e-05, "loss": 0.7420679092407226, "step": 250 }, { "epoch": 0.008329862557267805, "grad_norm": 2.7433625896377887, "learning_rate": 2e-05, "loss": 0.8062055587768555, "step": 260 }, { "epoch": 0.00865024188639349, "grad_norm": 4.993469336501579, "learning_rate": 2e-05, "loss": 0.7772369384765625, "step": 270 }, { "epoch": 0.008970621215519175, "grad_norm": 5.978072597304008, "learning_rate": 2e-05, "loss": 0.7567183494567871, "step": 280 }, { "epoch": 0.00929100054464486, "grad_norm": 20.0019916771175, "learning_rate": 2e-05, "loss": 0.7632350921630859, "step": 290 }, { "epoch": 0.009611379873770544, "grad_norm": 1813.803400221406, "learning_rate": 2e-05, "loss": 0.7820405006408692, "step": 300 }, { "epoch": 0.00993175920289623, "grad_norm": 15.257478921571794, "learning_rate": 2e-05, "loss": 0.8594757080078125, "step": 310 }, { "epoch": 0.010252138532021914, "grad_norm": 26.97548621262987, "learning_rate": 2e-05, "loss": 0.8610923767089844, "step": 320 }, { "epoch": 0.0105725178611476, "grad_norm": 21.892790276243126, "learning_rate": 2e-05, "loss": 0.8686389923095703, "step": 330 }, { "epoch": 0.010892897190273284, "grad_norm": 16.06260184223094, "learning_rate": 2e-05, "loss": 0.8639827728271484, "step": 340 }, { "epoch": 0.011213276519398968, "grad_norm": 29.260614803206966, "learning_rate": 2e-05, "loss": 0.7904685497283935, "step": 350 }, { "epoch": 0.011533655848524654, "grad_norm": 16.44688311222318, "learning_rate": 2e-05, "loss": 0.8587644577026368, "step": 360 }, { "epoch": 0.011854035177650338, "grad_norm": 70.37237245987374, "learning_rate": 2e-05, "loss": 0.8287432670593262, "step": 370 }, { "epoch": 0.012174414506776024, "grad_norm": 7.352519778805397, "learning_rate": 2e-05, "loss": 0.8243340492248535, "step": 380 }, { "epoch": 0.012494793835901708, "grad_norm": 7.57180002114558, "learning_rate": 2e-05, "loss": 0.8488252639770508, "step": 390 }, { "epoch": 0.012815173165027392, "grad_norm": 4.028963614155682, "learning_rate": 2e-05, "loss": 0.800967788696289, "step": 400 }, { "epoch": 0.013135552494153078, "grad_norm": 7.604607607710578, "learning_rate": 2e-05, "loss": 0.8435401916503906, "step": 410 }, { "epoch": 0.013455931823278762, "grad_norm": 5.686576942826079, "learning_rate": 2e-05, "loss": 0.8086394309997559, "step": 420 }, { "epoch": 0.013776311152404446, "grad_norm": 29.16934098168494, "learning_rate": 2e-05, "loss": 0.8092558860778809, "step": 430 }, { "epoch": 0.014096690481530132, "grad_norm": 7.838527647928418, "learning_rate": 2e-05, "loss": 0.7873313903808594, "step": 440 }, { "epoch": 0.014417069810655816, "grad_norm": 4.360151373268049, "learning_rate": 2e-05, "loss": 0.8105262756347656, "step": 450 }, { "epoch": 0.014737449139781502, "grad_norm": 3.093592672180748, "learning_rate": 2e-05, "loss": 0.7954371452331543, "step": 460 }, { "epoch": 0.015057828468907186, "grad_norm": 2.8867780320165948, "learning_rate": 2e-05, "loss": 0.7867568969726563, "step": 470 }, { "epoch": 0.01537820779803287, "grad_norm": 2.5525945956595404, "learning_rate": 2e-05, "loss": 0.7605972290039062, "step": 480 }, { "epoch": 0.015698587127158554, "grad_norm": 4.350350397516954, "learning_rate": 2e-05, "loss": 0.7946616172790527, "step": 490 }, { "epoch": 0.016018966456284242, "grad_norm": 2.5601326184252624, "learning_rate": 2e-05, "loss": 0.7657347679138183, "step": 500 }, { "epoch": 0.016339345785409926, "grad_norm": 3.0411596315285943, "learning_rate": 2e-05, "loss": 0.7469792366027832, "step": 510 }, { "epoch": 0.01665972511453561, "grad_norm": 1.6677799044175043, "learning_rate": 2e-05, "loss": 0.737004280090332, "step": 520 }, { "epoch": 0.016980104443661295, "grad_norm": 4.326231014259539, "learning_rate": 2e-05, "loss": 0.7799790859222412, "step": 530 }, { "epoch": 0.01730048377278698, "grad_norm": 2.732975416289203, "learning_rate": 2e-05, "loss": 0.8164985656738282, "step": 540 }, { "epoch": 0.017620863101912666, "grad_norm": 2.1962459439491036, "learning_rate": 2e-05, "loss": 0.7743217468261718, "step": 550 }, { "epoch": 0.01794124243103835, "grad_norm": 4.329667095154606, "learning_rate": 2e-05, "loss": 0.8150390625, "step": 560 }, { "epoch": 0.018261621760164035, "grad_norm": 1.7505089770107007, "learning_rate": 2e-05, "loss": 0.8161712646484375, "step": 570 }, { "epoch": 0.01858200108928972, "grad_norm": 1.94080520422082, "learning_rate": 2e-05, "loss": 0.7340856075286866, "step": 580 }, { "epoch": 0.018902380418415403, "grad_norm": 3.767043072114596, "learning_rate": 2e-05, "loss": 0.7465179443359375, "step": 590 }, { "epoch": 0.019222759747541087, "grad_norm": 2.134739515696804, "learning_rate": 2e-05, "loss": 0.7511123657226563, "step": 600 }, { "epoch": 0.019543139076666775, "grad_norm": 2.6553715328436724, "learning_rate": 2e-05, "loss": 0.7474520683288575, "step": 610 }, { "epoch": 0.01986351840579246, "grad_norm": 23.554705629944248, "learning_rate": 2e-05, "loss": 0.7547467708587646, "step": 620 }, { "epoch": 0.020183897734918143, "grad_norm": 9.663715178820514, "learning_rate": 2e-05, "loss": 0.7591798782348633, "step": 630 }, { "epoch": 0.020504277064043827, "grad_norm": 2.857655614152204, "learning_rate": 2e-05, "loss": 0.7372615814208985, "step": 640 }, { "epoch": 0.02082465639316951, "grad_norm": 19.794443617215876, "learning_rate": 2e-05, "loss": 0.7473020076751709, "step": 650 }, { "epoch": 0.0211450357222952, "grad_norm": 3.4519708452708513, "learning_rate": 2e-05, "loss": 0.7669941902160644, "step": 660 }, { "epoch": 0.021465415051420883, "grad_norm": 4.439475537657204, "learning_rate": 2e-05, "loss": 0.7708707809448242, "step": 670 }, { "epoch": 0.021785794380546567, "grad_norm": 4.288236090232602, "learning_rate": 2e-05, "loss": 0.75105299949646, "step": 680 }, { "epoch": 0.02210617370967225, "grad_norm": 19.247483032059645, "learning_rate": 2e-05, "loss": 0.7456221580505371, "step": 690 }, { "epoch": 0.022426553038797935, "grad_norm": 6.277608344095431, "learning_rate": 2e-05, "loss": 0.772921371459961, "step": 700 }, { "epoch": 0.022746932367923623, "grad_norm": 3.5768536610883284, "learning_rate": 2e-05, "loss": 0.7416125297546386, "step": 710 }, { "epoch": 0.023067311697049307, "grad_norm": 15.05269132810213, "learning_rate": 2e-05, "loss": 0.7103744506835937, "step": 720 }, { "epoch": 0.02338769102617499, "grad_norm": 4.468376174246059, "learning_rate": 2e-05, "loss": 0.727785873413086, "step": 730 }, { "epoch": 0.023708070355300676, "grad_norm": 5.087071299517523, "learning_rate": 2e-05, "loss": 0.7700984477996826, "step": 740 }, { "epoch": 0.02402844968442636, "grad_norm": 11.288253253171709, "learning_rate": 2e-05, "loss": 0.7581868648529053, "step": 750 }, { "epoch": 0.024348829013552047, "grad_norm": 3.27468779155936, "learning_rate": 2e-05, "loss": 0.7562522888183594, "step": 760 }, { "epoch": 0.02466920834267773, "grad_norm": 7.595749246101231, "learning_rate": 2e-05, "loss": 0.7546162605285645, "step": 770 }, { "epoch": 0.024989587671803416, "grad_norm": 2.1701956042711728, "learning_rate": 2e-05, "loss": 0.7503818511962891, "step": 780 }, { "epoch": 0.0253099670009291, "grad_norm": 7.551313750149006, "learning_rate": 2e-05, "loss": 0.7194967269897461, "step": 790 }, { "epoch": 0.025630346330054784, "grad_norm": 3.0982279258014085, "learning_rate": 2e-05, "loss": 0.7183728218078613, "step": 800 }, { "epoch": 0.025950725659180468, "grad_norm": 2.2319456779746507, "learning_rate": 2e-05, "loss": 0.741051197052002, "step": 810 }, { "epoch": 0.026271104988306156, "grad_norm": 2.1272967612583904, "learning_rate": 2e-05, "loss": 0.7074191093444824, "step": 820 }, { "epoch": 0.02659148431743184, "grad_norm": 2.3756745796722125, "learning_rate": 2e-05, "loss": 0.7466435909271241, "step": 830 }, { "epoch": 0.026911863646557524, "grad_norm": 3.9008908753860925, "learning_rate": 2e-05, "loss": 0.7262076377868653, "step": 840 }, { "epoch": 0.027232242975683208, "grad_norm": 2.0561831766929806, "learning_rate": 2e-05, "loss": 0.7282081604003906, "step": 850 }, { "epoch": 0.027552622304808892, "grad_norm": 5.818198655017998, "learning_rate": 2e-05, "loss": 0.7566670894622802, "step": 860 }, { "epoch": 0.02787300163393458, "grad_norm": 2.1494490230827337, "learning_rate": 2e-05, "loss": 0.7288908958435059, "step": 870 }, { "epoch": 0.028193380963060264, "grad_norm": 1.409242496714709, "learning_rate": 2e-05, "loss": 0.7215320587158203, "step": 880 }, { "epoch": 0.028513760292185948, "grad_norm": 7.0920590147047164, "learning_rate": 2e-05, "loss": 0.7246700286865234, "step": 890 }, { "epoch": 0.028834139621311632, "grad_norm": 1.5684095793164903, "learning_rate": 2e-05, "loss": 0.7144109725952148, "step": 900 }, { "epoch": 0.029154518950437316, "grad_norm": 1.3316395400018082, "learning_rate": 2e-05, "loss": 0.7477982997894287, "step": 910 }, { "epoch": 0.029474898279563004, "grad_norm": 1.3602729023468434, "learning_rate": 2e-05, "loss": 0.7173037528991699, "step": 920 }, { "epoch": 0.029795277608688688, "grad_norm": 49.53643391306756, "learning_rate": 2e-05, "loss": 0.7678704738616944, "step": 930 }, { "epoch": 0.030115656937814372, "grad_norm": 4.340394359223178, "learning_rate": 2e-05, "loss": 0.7031218528747558, "step": 940 }, { "epoch": 0.030436036266940057, "grad_norm": 2.1203555620583736, "learning_rate": 2e-05, "loss": 0.7084536552429199, "step": 950 }, { "epoch": 0.03075641559606574, "grad_norm": 1.3371075573755178, "learning_rate": 2e-05, "loss": 0.7464202880859375, "step": 960 }, { "epoch": 0.03107679492519143, "grad_norm": 1.6473009838115498, "learning_rate": 2e-05, "loss": 0.7116725444793701, "step": 970 }, { "epoch": 0.03139717425431711, "grad_norm": 3.385121877804678, "learning_rate": 2e-05, "loss": 0.738076114654541, "step": 980 }, { "epoch": 0.0317175535834428, "grad_norm": 1.7147230699245448, "learning_rate": 2e-05, "loss": 0.7158563137054443, "step": 990 }, { "epoch": 0.032037932912568484, "grad_norm": 3.3445220753393468, "learning_rate": 2e-05, "loss": 0.8030566215515137, "step": 1000 }, { "epoch": 0.032358312241694165, "grad_norm": 2.077502109986157, "learning_rate": 2e-05, "loss": 0.7472703456878662, "step": 1010 }, { "epoch": 0.03267869157081985, "grad_norm": 17.329143506946714, "learning_rate": 2e-05, "loss": 0.7366230964660645, "step": 1020 }, { "epoch": 0.03299907089994553, "grad_norm": 2.6268238025254735, "learning_rate": 2e-05, "loss": 0.7404189109802246, "step": 1030 }, { "epoch": 0.03331945022907122, "grad_norm": 1.977866371730136, "learning_rate": 2e-05, "loss": 0.7236545085906982, "step": 1040 }, { "epoch": 0.03363982955819691, "grad_norm": 1.498659413315871, "learning_rate": 2e-05, "loss": 0.7335420608520508, "step": 1050 }, { "epoch": 0.03396020888732259, "grad_norm": 1.7062214656423396, "learning_rate": 2e-05, "loss": 0.7051788330078125, "step": 1060 }, { "epoch": 0.03428058821644828, "grad_norm": 1.3397922877558162, "learning_rate": 2e-05, "loss": 0.7626142024993896, "step": 1070 }, { "epoch": 0.03460096754557396, "grad_norm": 3.93050291862445, "learning_rate": 2e-05, "loss": 0.7514806270599366, "step": 1080 }, { "epoch": 0.034921346874699645, "grad_norm": 3.398990137450838, "learning_rate": 2e-05, "loss": 0.7132882595062255, "step": 1090 }, { "epoch": 0.03524172620382533, "grad_norm": 1.4600798546048035, "learning_rate": 2e-05, "loss": 0.716385793685913, "step": 1100 }, { "epoch": 0.03556210553295101, "grad_norm": 1.3160301135986112, "learning_rate": 2e-05, "loss": 0.7191272735595703, "step": 1110 }, { "epoch": 0.0358824848620767, "grad_norm": 1.2481731524679547, "learning_rate": 2e-05, "loss": 0.7158429145812988, "step": 1120 }, { "epoch": 0.03620286419120238, "grad_norm": 2.8179317711592504, "learning_rate": 2e-05, "loss": 0.7038905143737793, "step": 1130 }, { "epoch": 0.03652324352032807, "grad_norm": 1.8284267025580432, "learning_rate": 2e-05, "loss": 0.7065417289733886, "step": 1140 }, { "epoch": 0.03684362284945375, "grad_norm": 2.212892645914091, "learning_rate": 2e-05, "loss": 0.7265023708343505, "step": 1150 }, { "epoch": 0.03716400217857944, "grad_norm": 2.2597923858522404, "learning_rate": 2e-05, "loss": 0.7199366569519043, "step": 1160 }, { "epoch": 0.037484381507705125, "grad_norm": 2.0160695548330936, "learning_rate": 2e-05, "loss": 0.7658578395843506, "step": 1170 }, { "epoch": 0.037804760836830806, "grad_norm": 2.5572488896871843, "learning_rate": 2e-05, "loss": 0.7220034599304199, "step": 1180 }, { "epoch": 0.03812514016595649, "grad_norm": 2.459122478774182, "learning_rate": 2e-05, "loss": 0.6983201026916503, "step": 1190 }, { "epoch": 0.038445519495082174, "grad_norm": 5.318818273924634, "learning_rate": 2e-05, "loss": 0.7152614116668701, "step": 1200 }, { "epoch": 0.03876589882420786, "grad_norm": 4.348661337562832, "learning_rate": 2e-05, "loss": 0.7531236171722412, "step": 1210 }, { "epoch": 0.03908627815333355, "grad_norm": 3.5073096880649666, "learning_rate": 2e-05, "loss": 0.7070003509521484, "step": 1220 }, { "epoch": 0.03940665748245923, "grad_norm": 6.250765626260255, "learning_rate": 2e-05, "loss": 0.7422648429870605, "step": 1230 }, { "epoch": 0.03972703681158492, "grad_norm": 2.1134272476858693, "learning_rate": 2e-05, "loss": 0.7167387962341308, "step": 1240 }, { "epoch": 0.0400474161407106, "grad_norm": 2.728613864385018, "learning_rate": 2e-05, "loss": 0.7613626480102539, "step": 1250 }, { "epoch": 0.040367795469836286, "grad_norm": 2.8289243765180094, "learning_rate": 2e-05, "loss": 0.7406154155731202, "step": 1260 }, { "epoch": 0.040688174798961974, "grad_norm": 1.460978022101602, "learning_rate": 2e-05, "loss": 0.7171460628509522, "step": 1270 }, { "epoch": 0.041008554128087654, "grad_norm": 11.187948658326427, "learning_rate": 2e-05, "loss": 0.7119218349456787, "step": 1280 }, { "epoch": 0.04132893345721334, "grad_norm": 1.5366780655953838, "learning_rate": 2e-05, "loss": 0.7250003337860107, "step": 1290 }, { "epoch": 0.04164931278633902, "grad_norm": 2.6451401695263392, "learning_rate": 2e-05, "loss": 0.7535340785980225, "step": 1300 }, { "epoch": 0.04196969211546471, "grad_norm": 5.247231775991024, "learning_rate": 2e-05, "loss": 0.7120182991027832, "step": 1310 }, { "epoch": 0.0422900714445904, "grad_norm": 1.265414487137248, "learning_rate": 2e-05, "loss": 0.7114714622497559, "step": 1320 }, { "epoch": 0.04261045077371608, "grad_norm": 32.52328999465322, "learning_rate": 2e-05, "loss": 0.6845267295837403, "step": 1330 }, { "epoch": 0.042930830102841766, "grad_norm": 6.1768247607509394, "learning_rate": 2e-05, "loss": 0.702857780456543, "step": 1340 }, { "epoch": 0.04325120943196745, "grad_norm": 7.1933410968196725, "learning_rate": 2e-05, "loss": 0.72010817527771, "step": 1350 }, { "epoch": 0.043571588761093134, "grad_norm": 1.1755562476246728, "learning_rate": 2e-05, "loss": 0.6978877067565918, "step": 1360 }, { "epoch": 0.04389196809021882, "grad_norm": 2.8540830213502844, "learning_rate": 2e-05, "loss": 0.7204657554626465, "step": 1370 }, { "epoch": 0.0442123474193445, "grad_norm": 1.1871852286932287, "learning_rate": 2e-05, "loss": 0.7182430267333985, "step": 1380 }, { "epoch": 0.04453272674847019, "grad_norm": 1.0566209393736636, "learning_rate": 2e-05, "loss": 0.7123696804046631, "step": 1390 }, { "epoch": 0.04485310607759587, "grad_norm": 4.237024261846737, "learning_rate": 2e-05, "loss": 0.6963154792785644, "step": 1400 }, { "epoch": 0.04517348540672156, "grad_norm": 2.008976090493564, "learning_rate": 2e-05, "loss": 0.6849660396575927, "step": 1410 }, { "epoch": 0.045493864735847246, "grad_norm": 1.3493113476458192, "learning_rate": 2e-05, "loss": 0.7087863922119141, "step": 1420 }, { "epoch": 0.04581424406497293, "grad_norm": 1.0453265260241618, "learning_rate": 2e-05, "loss": 0.6820076942443848, "step": 1430 }, { "epoch": 0.046134623394098614, "grad_norm": 1.367769743280532, "learning_rate": 2e-05, "loss": 0.7149313926696778, "step": 1440 }, { "epoch": 0.046455002723224295, "grad_norm": 1.5424097504581287, "learning_rate": 2e-05, "loss": 0.7253753185272217, "step": 1450 }, { "epoch": 0.04677538205234998, "grad_norm": 2.3372729347553025, "learning_rate": 2e-05, "loss": 0.7671535015106201, "step": 1460 }, { "epoch": 0.04709576138147567, "grad_norm": 1.8742828809078558, "learning_rate": 2e-05, "loss": 0.7182416915893555, "step": 1470 }, { "epoch": 0.04741614071060135, "grad_norm": 6.87172572472952, "learning_rate": 2e-05, "loss": 0.7154425621032715, "step": 1480 }, { "epoch": 0.04773652003972704, "grad_norm": 2.4729840403642545, "learning_rate": 2e-05, "loss": 0.7049578666687012, "step": 1490 }, { "epoch": 0.04805689936885272, "grad_norm": 1.3804743410158802, "learning_rate": 2e-05, "loss": 0.7238261222839355, "step": 1500 }, { "epoch": 0.04837727869797841, "grad_norm": 1.2556616325656202, "learning_rate": 2e-05, "loss": 0.7582721710205078, "step": 1510 }, { "epoch": 0.048697658027104095, "grad_norm": 1.4068662819395166, "learning_rate": 2e-05, "loss": 0.6943454742431641, "step": 1520 }, { "epoch": 0.049018037356229775, "grad_norm": 1.5191574570193485, "learning_rate": 2e-05, "loss": 0.7089879512786865, "step": 1530 }, { "epoch": 0.04933841668535546, "grad_norm": 1.1100647663489502, "learning_rate": 2e-05, "loss": 0.6814855098724365, "step": 1540 }, { "epoch": 0.049658796014481144, "grad_norm": 1.2368089337986163, "learning_rate": 2e-05, "loss": 0.7276053428649902, "step": 1550 }, { "epoch": 0.04997917534360683, "grad_norm": 1.596887157213148, "learning_rate": 2e-05, "loss": 0.7387615203857422, "step": 1560 }, { "epoch": 0.05029955467273251, "grad_norm": 1.3857783026385584, "learning_rate": 2e-05, "loss": 0.6814603805541992, "step": 1570 }, { "epoch": 0.0506199340018582, "grad_norm": 1.5717792680161595, "learning_rate": 2e-05, "loss": 0.6634132385253906, "step": 1580 }, { "epoch": 0.05094031333098389, "grad_norm": 5.076622025769138, "learning_rate": 2e-05, "loss": 0.7170121669769287, "step": 1590 }, { "epoch": 0.05126069266010957, "grad_norm": 3.075120261257635, "learning_rate": 2e-05, "loss": 0.6901824951171875, "step": 1600 }, { "epoch": 0.051581071989235255, "grad_norm": 3.1443073556392838, "learning_rate": 2e-05, "loss": 0.7126097679138184, "step": 1610 }, { "epoch": 0.051901451318360936, "grad_norm": 1.3279065854265553, "learning_rate": 2e-05, "loss": 0.696572208404541, "step": 1620 }, { "epoch": 0.052221830647486624, "grad_norm": 2.2922495579972213, "learning_rate": 2e-05, "loss": 0.7236587047576905, "step": 1630 }, { "epoch": 0.05254220997661231, "grad_norm": 1.853599288786833, "learning_rate": 2e-05, "loss": 0.6959040641784668, "step": 1640 }, { "epoch": 0.05286258930573799, "grad_norm": 1.6356938422959257, "learning_rate": 2e-05, "loss": 0.6883045196533203, "step": 1650 }, { "epoch": 0.05318296863486368, "grad_norm": 1.4258158618988481, "learning_rate": 2e-05, "loss": 0.7095949172973632, "step": 1660 }, { "epoch": 0.05350334796398936, "grad_norm": 1.3818626048983265, "learning_rate": 2e-05, "loss": 0.7279641628265381, "step": 1670 }, { "epoch": 0.05382372729311505, "grad_norm": 1.3148725391903133, "learning_rate": 2e-05, "loss": 0.7071706295013428, "step": 1680 }, { "epoch": 0.054144106622240736, "grad_norm": 1.3205843385485543, "learning_rate": 2e-05, "loss": 0.7102875709533691, "step": 1690 }, { "epoch": 0.054464485951366416, "grad_norm": 1.0245118537391376, "learning_rate": 2e-05, "loss": 0.7355536460876465, "step": 1700 }, { "epoch": 0.054784865280492104, "grad_norm": 0.9830319826014532, "learning_rate": 2e-05, "loss": 0.711072301864624, "step": 1710 }, { "epoch": 0.055105244609617784, "grad_norm": 2.2427073223135, "learning_rate": 2e-05, "loss": 0.7257272720336914, "step": 1720 }, { "epoch": 0.05542562393874347, "grad_norm": 1.7432652030049554, "learning_rate": 2e-05, "loss": 0.7266391754150391, "step": 1730 }, { "epoch": 0.05574600326786916, "grad_norm": 7.3855085380936965, "learning_rate": 2e-05, "loss": 0.7229394435882568, "step": 1740 }, { "epoch": 0.05606638259699484, "grad_norm": 2.1417039515536542, "learning_rate": 2e-05, "loss": 0.6833599090576172, "step": 1750 }, { "epoch": 0.05638676192612053, "grad_norm": 2.4468519837946165, "learning_rate": 2e-05, "loss": 0.7663132667541503, "step": 1760 }, { "epoch": 0.05670714125524621, "grad_norm": 3.0137174378050293, "learning_rate": 2e-05, "loss": 0.7224421977996827, "step": 1770 }, { "epoch": 0.057027520584371896, "grad_norm": 2.2523438896707706, "learning_rate": 2e-05, "loss": 0.7207423210144043, "step": 1780 }, { "epoch": 0.057347899913497584, "grad_norm": 2.919705865322085, "learning_rate": 2e-05, "loss": 0.6854898452758789, "step": 1790 }, { "epoch": 0.057668279242623265, "grad_norm": 3.984396788478948, "learning_rate": 2e-05, "loss": 0.7234033107757568, "step": 1800 }, { "epoch": 0.05798865857174895, "grad_norm": 6.67851094941151, "learning_rate": 2e-05, "loss": 0.7022351264953614, "step": 1810 }, { "epoch": 0.05830903790087463, "grad_norm": 1.6866126836675677, "learning_rate": 2e-05, "loss": 0.7415154457092286, "step": 1820 }, { "epoch": 0.05862941723000032, "grad_norm": 3.218820869797509, "learning_rate": 2e-05, "loss": 0.7005694389343262, "step": 1830 }, { "epoch": 0.05894979655912601, "grad_norm": 3.0737908739781106, "learning_rate": 2e-05, "loss": 0.6981851100921631, "step": 1840 }, { "epoch": 0.05927017588825169, "grad_norm": 2.2327032848527795, "learning_rate": 2e-05, "loss": 0.7604454040527344, "step": 1850 }, { "epoch": 0.059590555217377376, "grad_norm": 2.8761311961580973, "learning_rate": 2e-05, "loss": 0.6888795852661133, "step": 1860 }, { "epoch": 0.05991093454650306, "grad_norm": 2.2317201691382533, "learning_rate": 2e-05, "loss": 0.708838415145874, "step": 1870 }, { "epoch": 0.060231313875628745, "grad_norm": 2.0355186191234806, "learning_rate": 2e-05, "loss": 0.7040927886962891, "step": 1880 }, { "epoch": 0.06055169320475443, "grad_norm": 2.014047361446366, "learning_rate": 2e-05, "loss": 0.7197917461395263, "step": 1890 }, { "epoch": 0.06087207253388011, "grad_norm": 1.977104681851146, "learning_rate": 2e-05, "loss": 0.6776611328125, "step": 1900 }, { "epoch": 0.0611924518630058, "grad_norm": 13.901447338457938, "learning_rate": 2e-05, "loss": 0.6899932861328125, "step": 1910 }, { "epoch": 0.06151283119213148, "grad_norm": 2.1123993495266435, "learning_rate": 2e-05, "loss": 0.6683700084686279, "step": 1920 }, { "epoch": 0.06183321052125717, "grad_norm": 2.3306798040564676, "learning_rate": 2e-05, "loss": 0.691620922088623, "step": 1930 }, { "epoch": 0.06215358985038286, "grad_norm": 13.395393364218384, "learning_rate": 2e-05, "loss": 0.7234976768493653, "step": 1940 }, { "epoch": 0.06247396917950854, "grad_norm": 7.087449907589583, "learning_rate": 2e-05, "loss": 0.7050728797912598, "step": 1950 }, { "epoch": 0.06279434850863422, "grad_norm": 2.912496650205425, "learning_rate": 2e-05, "loss": 0.6966752529144287, "step": 1960 }, { "epoch": 0.06311472783775991, "grad_norm": 8.623415554665941, "learning_rate": 2e-05, "loss": 0.67595534324646, "step": 1970 }, { "epoch": 0.0634351071668856, "grad_norm": 3.239938193275378, "learning_rate": 2e-05, "loss": 0.6972695350646972, "step": 1980 }, { "epoch": 0.06375548649601127, "grad_norm": 4.165992500546785, "learning_rate": 2e-05, "loss": 0.7464128017425538, "step": 1990 }, { "epoch": 0.06407586582513697, "grad_norm": 3.308146075178026, "learning_rate": 2e-05, "loss": 0.7509006023406982, "step": 2000 }, { "epoch": 0.06439624515426265, "grad_norm": 3.4969526861271802, "learning_rate": 2e-05, "loss": 0.7300586700439453, "step": 2010 }, { "epoch": 0.06471662448338833, "grad_norm": 4.743378784447764, "learning_rate": 2e-05, "loss": 0.6886860847473144, "step": 2020 }, { "epoch": 0.06503700381251401, "grad_norm": 1.9438372463888733, "learning_rate": 2e-05, "loss": 0.705808448791504, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 963613493821440.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }