Download 200M/trainer_state.json from SynthCode-Project/rv2-gemma12b-g2_4_plan_cm_oldcode_newcode: direct link, hf CLI and curl.
- Browser
- Download file 35.6 kB
-
https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_4_plan_cm_oldcode_newcode/resolve/main/200M/trainer_state.json
- Command line
-
hf download hf://SynthCode-Project/rv2-gemma12b-g2_4_plan_cm_oldcode_newcode/200M/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_4_plan_cm_oldcode_newcode/resolve/main/200M/trainer_state.json
35.6 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.06519719347707686, | |
| "eval_steps": 500, | |
| "global_step": 2035, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0003203793291256848, | |
| "grad_norm": 2697.9695951365356, | |
| "learning_rate": 2.910112359550562e-06, | |
| "loss": 2.1080955505371093, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0006407586582513696, | |
| "grad_norm": 150.28792394404246, | |
| "learning_rate": 3.921348314606742e-06, | |
| "loss": 1.051735782623291, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0009611379873770544, | |
| "grad_norm": 11.728004906904669, | |
| "learning_rate": 4.932584269662922e-06, | |
| "loss": 0.8452852249145508, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0012815173165027392, | |
| "grad_norm": 79.82045143025138, | |
| "learning_rate": 5.943820224719102e-06, | |
| "loss": 0.8374807357788085, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.001601896645628424, | |
| "grad_norm": 15.487828868814473, | |
| "learning_rate": 6.955056179775282e-06, | |
| "loss": 0.8031275749206543, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0019222759747541088, | |
| "grad_norm": 26.189373840069653, | |
| "learning_rate": 7.966292134831462e-06, | |
| "loss": 0.7619327545166016, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.002242655303879794, | |
| "grad_norm": 24.510054444181353, | |
| "learning_rate": 8.977528089887641e-06, | |
| "loss": 0.788119888305664, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0025630346330054784, | |
| "grad_norm": 27.619677813912134, | |
| "learning_rate": 9.988764044943822e-06, | |
| "loss": 0.8074554443359375, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.0028834139621311634, | |
| "grad_norm": 53.27561070809039, | |
| "learning_rate": 1.1000000000000001e-05, | |
| "loss": 0.7780509948730469, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.003203793291256848, | |
| "grad_norm": 20.22293994140261, | |
| "learning_rate": 1.2011235955056182e-05, | |
| "loss": 0.7639347076416015, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.003524172620382533, | |
| "grad_norm": 28.55291130912943, | |
| "learning_rate": 1.3022471910112362e-05, | |
| "loss": 0.7700469970703125, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.0038445519495082176, | |
| "grad_norm": 7.520305767933223, | |
| "learning_rate": 1.403370786516854e-05, | |
| "loss": 0.7953043937683105, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.004164931278633903, | |
| "grad_norm": 96.08078842951305, | |
| "learning_rate": 1.504494382022472e-05, | |
| "loss": 0.8506025314331055, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.004485310607759588, | |
| "grad_norm": 948.131373093307, | |
| "learning_rate": 1.60561797752809e-05, | |
| "loss": 0.8122509002685547, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.004805689936885272, | |
| "grad_norm": 128.55037969805156, | |
| "learning_rate": 1.706741573033708e-05, | |
| "loss": 0.7938695907592773, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.005126069266010957, | |
| "grad_norm": 25.93618158094234, | |
| "learning_rate": 1.8078651685393256e-05, | |
| "loss": 0.8438175201416016, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.005446448595136642, | |
| "grad_norm": 9.528266971779534, | |
| "learning_rate": 1.908988764044944e-05, | |
| "loss": 0.9011789321899414, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.005766827924262327, | |
| "grad_norm": 4.6353029582495315, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8190475463867187, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.006087207253388012, | |
| "grad_norm": 7.804600561994388, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7879319667816163, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.006407586582513696, | |
| "grad_norm": 8.759193053432988, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8373113632202148, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.006727965911639381, | |
| "grad_norm": 5.7645630188571495, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8225456237792969, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.007048345240765066, | |
| "grad_norm": 2.975476645382291, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7898527145385742, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.007368724569890751, | |
| "grad_norm": 3.5660713690110923, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7848415374755859, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.007689103899016435, | |
| "grad_norm": 3.776542520178389, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7830493927001954, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.008009483228142121, | |
| "grad_norm": 5.652886706438173, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7420679092407226, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.008329862557267805, | |
| "grad_norm": 2.7433625896377887, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8062055587768555, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.00865024188639349, | |
| "grad_norm": 4.993469336501579, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7772369384765625, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.008970621215519175, | |
| "grad_norm": 5.978072597304008, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7567183494567871, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.00929100054464486, | |
| "grad_norm": 20.0019916771175, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7632350921630859, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.009611379873770544, | |
| "grad_norm": 1813.803400221406, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7820405006408692, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.00993175920289623, | |
| "grad_norm": 15.257478921571794, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8594757080078125, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.010252138532021914, | |
| "grad_norm": 26.97548621262987, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8610923767089844, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.0105725178611476, | |
| "grad_norm": 21.892790276243126, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8686389923095703, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.010892897190273284, | |
| "grad_norm": 16.06260184223094, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8639827728271484, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.011213276519398968, | |
| "grad_norm": 29.260614803206966, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7904685497283935, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.011533655848524654, | |
| "grad_norm": 16.44688311222318, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8587644577026368, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.011854035177650338, | |
| "grad_norm": 70.37237245987374, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8287432670593262, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.012174414506776024, | |
| "grad_norm": 7.352519778805397, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8243340492248535, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.012494793835901708, | |
| "grad_norm": 7.57180002114558, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8488252639770508, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.012815173165027392, | |
| "grad_norm": 4.028963614155682, | |
| "learning_rate": 2e-05, | |
| "loss": 0.800967788696289, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.013135552494153078, | |
| "grad_norm": 7.604607607710578, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8435401916503906, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.013455931823278762, | |
| "grad_norm": 5.686576942826079, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8086394309997559, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.013776311152404446, | |
| "grad_norm": 29.16934098168494, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8092558860778809, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.014096690481530132, | |
| "grad_norm": 7.838527647928418, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7873313903808594, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.014417069810655816, | |
| "grad_norm": 4.360151373268049, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8105262756347656, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.014737449139781502, | |
| "grad_norm": 3.093592672180748, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7954371452331543, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.015057828468907186, | |
| "grad_norm": 2.8867780320165948, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7867568969726563, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.01537820779803287, | |
| "grad_norm": 2.5525945956595404, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7605972290039062, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.015698587127158554, | |
| "grad_norm": 4.350350397516954, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7946616172790527, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.016018966456284242, | |
| "grad_norm": 2.5601326184252624, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7657347679138183, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.016339345785409926, | |
| "grad_norm": 3.0411596315285943, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7469792366027832, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.01665972511453561, | |
| "grad_norm": 1.6677799044175043, | |
| "learning_rate": 2e-05, | |
| "loss": 0.737004280090332, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.016980104443661295, | |
| "grad_norm": 4.326231014259539, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7799790859222412, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.01730048377278698, | |
| "grad_norm": 2.732975416289203, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8164985656738282, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.017620863101912666, | |
| "grad_norm": 2.1962459439491036, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7743217468261718, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.01794124243103835, | |
| "grad_norm": 4.329667095154606, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8150390625, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.018261621760164035, | |
| "grad_norm": 1.7505089770107007, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8161712646484375, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.01858200108928972, | |
| "grad_norm": 1.94080520422082, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7340856075286866, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.018902380418415403, | |
| "grad_norm": 3.767043072114596, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7465179443359375, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.019222759747541087, | |
| "grad_norm": 2.134739515696804, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7511123657226563, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.019543139076666775, | |
| "grad_norm": 2.6553715328436724, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7474520683288575, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.01986351840579246, | |
| "grad_norm": 23.554705629944248, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7547467708587646, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.020183897734918143, | |
| "grad_norm": 9.663715178820514, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7591798782348633, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.020504277064043827, | |
| "grad_norm": 2.857655614152204, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7372615814208985, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.02082465639316951, | |
| "grad_norm": 19.794443617215876, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7473020076751709, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.0211450357222952, | |
| "grad_norm": 3.4519708452708513, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7669941902160644, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.021465415051420883, | |
| "grad_norm": 4.439475537657204, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7708707809448242, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.021785794380546567, | |
| "grad_norm": 4.288236090232602, | |
| "learning_rate": 2e-05, | |
| "loss": 0.75105299949646, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.02210617370967225, | |
| "grad_norm": 19.247483032059645, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7456221580505371, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.022426553038797935, | |
| "grad_norm": 6.277608344095431, | |
| "learning_rate": 2e-05, | |
| "loss": 0.772921371459961, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.022746932367923623, | |
| "grad_norm": 3.5768536610883284, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7416125297546386, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.023067311697049307, | |
| "grad_norm": 15.05269132810213, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7103744506835937, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.02338769102617499, | |
| "grad_norm": 4.468376174246059, | |
| "learning_rate": 2e-05, | |
| "loss": 0.727785873413086, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.023708070355300676, | |
| "grad_norm": 5.087071299517523, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7700984477996826, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.02402844968442636, | |
| "grad_norm": 11.288253253171709, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7581868648529053, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.024348829013552047, | |
| "grad_norm": 3.27468779155936, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7562522888183594, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.02466920834267773, | |
| "grad_norm": 7.595749246101231, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7546162605285645, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.024989587671803416, | |
| "grad_norm": 2.1701956042711728, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7503818511962891, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.0253099670009291, | |
| "grad_norm": 7.551313750149006, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7194967269897461, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.025630346330054784, | |
| "grad_norm": 3.0982279258014085, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7183728218078613, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.025950725659180468, | |
| "grad_norm": 2.2319456779746507, | |
| "learning_rate": 2e-05, | |
| "loss": 0.741051197052002, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.026271104988306156, | |
| "grad_norm": 2.1272967612583904, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7074191093444824, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.02659148431743184, | |
| "grad_norm": 2.3756745796722125, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7466435909271241, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.026911863646557524, | |
| "grad_norm": 3.9008908753860925, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7262076377868653, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.027232242975683208, | |
| "grad_norm": 2.0561831766929806, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7282081604003906, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.027552622304808892, | |
| "grad_norm": 5.818198655017998, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7566670894622802, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.02787300163393458, | |
| "grad_norm": 2.1494490230827337, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7288908958435059, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.028193380963060264, | |
| "grad_norm": 1.409242496714709, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7215320587158203, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.028513760292185948, | |
| "grad_norm": 7.0920590147047164, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7246700286865234, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.028834139621311632, | |
| "grad_norm": 1.5684095793164903, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7144109725952148, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.029154518950437316, | |
| "grad_norm": 1.3316395400018082, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7477982997894287, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.029474898279563004, | |
| "grad_norm": 1.3602729023468434, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7173037528991699, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.029795277608688688, | |
| "grad_norm": 49.53643391306756, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7678704738616944, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.030115656937814372, | |
| "grad_norm": 4.340394359223178, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7031218528747558, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.030436036266940057, | |
| "grad_norm": 2.1203555620583736, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7084536552429199, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.03075641559606574, | |
| "grad_norm": 1.3371075573755178, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7464202880859375, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.03107679492519143, | |
| "grad_norm": 1.6473009838115498, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7116725444793701, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.03139717425431711, | |
| "grad_norm": 3.385121877804678, | |
| "learning_rate": 2e-05, | |
| "loss": 0.738076114654541, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.0317175535834428, | |
| "grad_norm": 1.7147230699245448, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7158563137054443, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.032037932912568484, | |
| "grad_norm": 3.3445220753393468, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8030566215515137, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.032358312241694165, | |
| "grad_norm": 2.077502109986157, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7472703456878662, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.03267869157081985, | |
| "grad_norm": 17.329143506946714, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7366230964660645, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.03299907089994553, | |
| "grad_norm": 2.6268238025254735, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7404189109802246, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.03331945022907122, | |
| "grad_norm": 1.977866371730136, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7236545085906982, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.03363982955819691, | |
| "grad_norm": 1.498659413315871, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7335420608520508, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.03396020888732259, | |
| "grad_norm": 1.7062214656423396, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7051788330078125, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.03428058821644828, | |
| "grad_norm": 1.3397922877558162, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7626142024993896, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.03460096754557396, | |
| "grad_norm": 3.93050291862445, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7514806270599366, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.034921346874699645, | |
| "grad_norm": 3.398990137450838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7132882595062255, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.03524172620382533, | |
| "grad_norm": 1.4600798546048035, | |
| "learning_rate": 2e-05, | |
| "loss": 0.716385793685913, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.03556210553295101, | |
| "grad_norm": 1.3160301135986112, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7191272735595703, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.0358824848620767, | |
| "grad_norm": 1.2481731524679547, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7158429145812988, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.03620286419120238, | |
| "grad_norm": 2.8179317711592504, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7038905143737793, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.03652324352032807, | |
| "grad_norm": 1.8284267025580432, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7065417289733886, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.03684362284945375, | |
| "grad_norm": 2.212892645914091, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7265023708343505, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.03716400217857944, | |
| "grad_norm": 2.2597923858522404, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7199366569519043, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.037484381507705125, | |
| "grad_norm": 2.0160695548330936, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7658578395843506, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.037804760836830806, | |
| "grad_norm": 2.5572488896871843, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7220034599304199, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.03812514016595649, | |
| "grad_norm": 2.459122478774182, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6983201026916503, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.038445519495082174, | |
| "grad_norm": 5.318818273924634, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7152614116668701, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.03876589882420786, | |
| "grad_norm": 4.348661337562832, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7531236171722412, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.03908627815333355, | |
| "grad_norm": 3.5073096880649666, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7070003509521484, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.03940665748245923, | |
| "grad_norm": 6.250765626260255, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7422648429870605, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.03972703681158492, | |
| "grad_norm": 2.1134272476858693, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7167387962341308, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.0400474161407106, | |
| "grad_norm": 2.728613864385018, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7613626480102539, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.040367795469836286, | |
| "grad_norm": 2.8289243765180094, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7406154155731202, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.040688174798961974, | |
| "grad_norm": 1.460978022101602, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7171460628509522, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.041008554128087654, | |
| "grad_norm": 11.187948658326427, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7119218349456787, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.04132893345721334, | |
| "grad_norm": 1.5366780655953838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7250003337860107, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.04164931278633902, | |
| "grad_norm": 2.6451401695263392, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7535340785980225, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.04196969211546471, | |
| "grad_norm": 5.247231775991024, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7120182991027832, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.0422900714445904, | |
| "grad_norm": 1.265414487137248, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7114714622497559, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.04261045077371608, | |
| "grad_norm": 32.52328999465322, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6845267295837403, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.042930830102841766, | |
| "grad_norm": 6.1768247607509394, | |
| "learning_rate": 2e-05, | |
| "loss": 0.702857780456543, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.04325120943196745, | |
| "grad_norm": 7.1933410968196725, | |
| "learning_rate": 2e-05, | |
| "loss": 0.72010817527771, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.043571588761093134, | |
| "grad_norm": 1.1755562476246728, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6978877067565918, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.04389196809021882, | |
| "grad_norm": 2.8540830213502844, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7204657554626465, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.0442123474193445, | |
| "grad_norm": 1.1871852286932287, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7182430267333985, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.04453272674847019, | |
| "grad_norm": 1.0566209393736636, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7123696804046631, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.04485310607759587, | |
| "grad_norm": 4.237024261846737, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6963154792785644, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.04517348540672156, | |
| "grad_norm": 2.008976090493564, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6849660396575927, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.045493864735847246, | |
| "grad_norm": 1.3493113476458192, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7087863922119141, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.04581424406497293, | |
| "grad_norm": 1.0453265260241618, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6820076942443848, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.046134623394098614, | |
| "grad_norm": 1.367769743280532, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7149313926696778, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.046455002723224295, | |
| "grad_norm": 1.5424097504581287, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7253753185272217, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.04677538205234998, | |
| "grad_norm": 2.3372729347553025, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7671535015106201, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.04709576138147567, | |
| "grad_norm": 1.8742828809078558, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7182416915893555, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.04741614071060135, | |
| "grad_norm": 6.87172572472952, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7154425621032715, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.04773652003972704, | |
| "grad_norm": 2.4729840403642545, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7049578666687012, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.04805689936885272, | |
| "grad_norm": 1.3804743410158802, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7238261222839355, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.04837727869797841, | |
| "grad_norm": 1.2556616325656202, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7582721710205078, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.048697658027104095, | |
| "grad_norm": 1.4068662819395166, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6943454742431641, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.049018037356229775, | |
| "grad_norm": 1.5191574570193485, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7089879512786865, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.04933841668535546, | |
| "grad_norm": 1.1100647663489502, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6814855098724365, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.049658796014481144, | |
| "grad_norm": 1.2368089337986163, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7276053428649902, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.04997917534360683, | |
| "grad_norm": 1.596887157213148, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7387615203857422, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.05029955467273251, | |
| "grad_norm": 1.3857783026385584, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6814603805541992, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.0506199340018582, | |
| "grad_norm": 1.5717792680161595, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6634132385253906, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.05094031333098389, | |
| "grad_norm": 5.076622025769138, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7170121669769287, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.05126069266010957, | |
| "grad_norm": 3.075120261257635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6901824951171875, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.051581071989235255, | |
| "grad_norm": 3.1443073556392838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7126097679138184, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.051901451318360936, | |
| "grad_norm": 1.3279065854265553, | |
| "learning_rate": 2e-05, | |
| "loss": 0.696572208404541, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.052221830647486624, | |
| "grad_norm": 2.2922495579972213, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7236587047576905, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.05254220997661231, | |
| "grad_norm": 1.853599288786833, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6959040641784668, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.05286258930573799, | |
| "grad_norm": 1.6356938422959257, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6883045196533203, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.05318296863486368, | |
| "grad_norm": 1.4258158618988481, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7095949172973632, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.05350334796398936, | |
| "grad_norm": 1.3818626048983265, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7279641628265381, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.05382372729311505, | |
| "grad_norm": 1.3148725391903133, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7071706295013428, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.054144106622240736, | |
| "grad_norm": 1.3205843385485543, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7102875709533691, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.054464485951366416, | |
| "grad_norm": 1.0245118537391376, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7355536460876465, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.054784865280492104, | |
| "grad_norm": 0.9830319826014532, | |
| "learning_rate": 2e-05, | |
| "loss": 0.711072301864624, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.055105244609617784, | |
| "grad_norm": 2.2427073223135, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7257272720336914, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.05542562393874347, | |
| "grad_norm": 1.7432652030049554, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7266391754150391, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.05574600326786916, | |
| "grad_norm": 7.3855085380936965, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7229394435882568, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.05606638259699484, | |
| "grad_norm": 2.1417039515536542, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6833599090576172, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.05638676192612053, | |
| "grad_norm": 2.4468519837946165, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7663132667541503, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.05670714125524621, | |
| "grad_norm": 3.0137174378050293, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7224421977996827, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.057027520584371896, | |
| "grad_norm": 2.2523438896707706, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7207423210144043, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.057347899913497584, | |
| "grad_norm": 2.919705865322085, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6854898452758789, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.057668279242623265, | |
| "grad_norm": 3.984396788478948, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7234033107757568, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.05798865857174895, | |
| "grad_norm": 6.67851094941151, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7022351264953614, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.05830903790087463, | |
| "grad_norm": 1.6866126836675677, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7415154457092286, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.05862941723000032, | |
| "grad_norm": 3.218820869797509, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7005694389343262, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.05894979655912601, | |
| "grad_norm": 3.0737908739781106, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6981851100921631, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.05927017588825169, | |
| "grad_norm": 2.2327032848527795, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7604454040527344, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.059590555217377376, | |
| "grad_norm": 2.8761311961580973, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6888795852661133, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.05991093454650306, | |
| "grad_norm": 2.2317201691382533, | |
| "learning_rate": 2e-05, | |
| "loss": 0.708838415145874, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.060231313875628745, | |
| "grad_norm": 2.0355186191234806, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7040927886962891, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.06055169320475443, | |
| "grad_norm": 2.014047361446366, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7197917461395263, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.06087207253388011, | |
| "grad_norm": 1.977104681851146, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6776611328125, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.0611924518630058, | |
| "grad_norm": 13.901447338457938, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6899932861328125, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.06151283119213148, | |
| "grad_norm": 2.1123993495266435, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6683700084686279, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.06183321052125717, | |
| "grad_norm": 2.3306798040564676, | |
| "learning_rate": 2e-05, | |
| "loss": 0.691620922088623, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.06215358985038286, | |
| "grad_norm": 13.395393364218384, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7234976768493653, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.06247396917950854, | |
| "grad_norm": 7.087449907589583, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7050728797912598, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.06279434850863422, | |
| "grad_norm": 2.912496650205425, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6966752529144287, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.06311472783775991, | |
| "grad_norm": 8.623415554665941, | |
| "learning_rate": 2e-05, | |
| "loss": 0.67595534324646, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.0634351071668856, | |
| "grad_norm": 3.239938193275378, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6972695350646972, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.06375548649601127, | |
| "grad_norm": 4.165992500546785, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7464128017425538, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.06407586582513697, | |
| "grad_norm": 3.308146075178026, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7509006023406982, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.06439624515426265, | |
| "grad_norm": 3.4969526861271802, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7300586700439453, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.06471662448338833, | |
| "grad_norm": 4.743378784447764, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6886860847473144, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.06503700381251401, | |
| "grad_norm": 1.9438372463888733, | |
| "learning_rate": 2e-05, | |
| "loss": 0.705808448791504, | |
| "step": 2030 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5935, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 2035, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 963613493821440.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |