Instructions to use codegenstudio/codegen-350M-sql2nosql-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use codegenstudio/codegen-350M-sql2nosql-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/kaggle/working/models/base/Salesforce__codegen-350M-multi") model = PeftModel.from_pretrained(base_model, "codegenstudio/codegen-350M-sql2nosql-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1500, | |
| "best_metric": 0.03645886108279228, | |
| "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/sql2nosql/checkpoint-1500", | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 1500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1209821447730064, | |
| "epoch": 0.020005001250312578, | |
| "grad_norm": 1.7302765846252441, | |
| "learning_rate": 7.2e-06, | |
| "loss": 1.3475940704345704, | |
| "mean_token_accuracy": 0.6775479473173618, | |
| "num_tokens": 65756.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.0718491852283478, | |
| "epoch": 0.040010002500625155, | |
| "grad_norm": 1.598680853843689, | |
| "learning_rate": 1.52e-05, | |
| "loss": 1.1782958984375, | |
| "mean_token_accuracy": 0.6978455670177937, | |
| "num_tokens": 127350.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.9551009342074395, | |
| "epoch": 0.06001500375093773, | |
| "grad_norm": 1.7650020122528076, | |
| "learning_rate": 2.32e-05, | |
| "loss": 0.9067621231079102, | |
| "mean_token_accuracy": 0.7337856531143189, | |
| "num_tokens": 191970.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.7395371329039335, | |
| "epoch": 0.08002000500125031, | |
| "grad_norm": 1.2754874229431152, | |
| "learning_rate": 3.12e-05, | |
| "loss": 0.6462621212005615, | |
| "mean_token_accuracy": 0.815752174705267, | |
| "num_tokens": 257775.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.5132245156913996, | |
| "epoch": 0.1000250062515629, | |
| "grad_norm": 1.6131094694137573, | |
| "learning_rate": 3.9200000000000004e-05, | |
| "loss": 0.4761983871459961, | |
| "mean_token_accuracy": 0.8625759541988373, | |
| "num_tokens": 319507.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.35333055444061756, | |
| "epoch": 0.12003000750187547, | |
| "grad_norm": 1.9517418146133423, | |
| "learning_rate": 4.72e-05, | |
| "loss": 0.34327900409698486, | |
| "mean_token_accuracy": 0.9010166764259339, | |
| "num_tokens": 380952.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.2581108913756907, | |
| "epoch": 0.14003500875218805, | |
| "grad_norm": 1.8101425170898438, | |
| "learning_rate": 5.520000000000001e-05, | |
| "loss": 0.25612337589263917, | |
| "mean_token_accuracy": 0.9237508125603199, | |
| "num_tokens": 443849.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.23392133321613073, | |
| "epoch": 0.16004001000250062, | |
| "grad_norm": 1.4003955125808716, | |
| "learning_rate": 6.32e-05, | |
| "loss": 0.20029537677764891, | |
| "mean_token_accuracy": 0.940458069741726, | |
| "num_tokens": 505868.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.1773814239539206, | |
| "epoch": 0.1800450112528132, | |
| "grad_norm": 1.2149077653884888, | |
| "learning_rate": 7.12e-05, | |
| "loss": 0.1597532272338867, | |
| "mean_token_accuracy": 0.9488845877349377, | |
| "num_tokens": 570792.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.16433264631778002, | |
| "epoch": 0.2000500125031258, | |
| "grad_norm": 1.4650107622146606, | |
| "learning_rate": 7.920000000000001e-05, | |
| "loss": 0.15449292659759523, | |
| "mean_token_accuracy": 0.9529499627649785, | |
| "num_tokens": 634476.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.1567419718950987, | |
| "epoch": 0.22005501375343836, | |
| "grad_norm": 1.2412768602371216, | |
| "learning_rate": 8.72e-05, | |
| "loss": 0.14979339838027955, | |
| "mean_token_accuracy": 0.9547351159155368, | |
| "num_tokens": 697928.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.14790078573860227, | |
| "epoch": 0.24006001500375093, | |
| "grad_norm": 1.0941258668899536, | |
| "learning_rate": 9.52e-05, | |
| "loss": 0.15537588596343993, | |
| "mean_token_accuracy": 0.9548502139747143, | |
| "num_tokens": 761970.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.14068418610841035, | |
| "epoch": 0.26006501625406353, | |
| "grad_norm": 1.3730136156082153, | |
| "learning_rate": 0.0001032, | |
| "loss": 0.12376174926757813, | |
| "mean_token_accuracy": 0.9643007285892964, | |
| "num_tokens": 827125.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.10366909941658378, | |
| "epoch": 0.2800700175043761, | |
| "grad_norm": 0.859259843826294, | |
| "learning_rate": 0.00011120000000000002, | |
| "loss": 0.10419689416885376, | |
| "mean_token_accuracy": 0.9708971530199051, | |
| "num_tokens": 890387.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.10762261427007616, | |
| "epoch": 0.30007501875468867, | |
| "grad_norm": 0.9888283610343933, | |
| "learning_rate": 0.0001192, | |
| "loss": 0.09227448105812072, | |
| "mean_token_accuracy": 0.9713370814919472, | |
| "num_tokens": 956032.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.1130900933407247, | |
| "epoch": 0.32008002000500124, | |
| "grad_norm": 0.9545535445213318, | |
| "learning_rate": 0.0001272, | |
| "loss": 0.1083062767982483, | |
| "mean_token_accuracy": 0.9707557298243046, | |
| "num_tokens": 1020072.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.0895556318340823, | |
| "epoch": 0.3400850212553138, | |
| "grad_norm": 0.9866153597831726, | |
| "learning_rate": 0.0001352, | |
| "loss": 0.07606152892112732, | |
| "mean_token_accuracy": 0.973467419296503, | |
| "num_tokens": 1083781.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.09170240506064146, | |
| "epoch": 0.3600900225056264, | |
| "grad_norm": 1.0180600881576538, | |
| "learning_rate": 0.0001432, | |
| "loss": 0.10022411346435547, | |
| "mean_token_accuracy": 0.9705780848860741, | |
| "num_tokens": 1145466.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.11426927694119512, | |
| "epoch": 0.380095023755939, | |
| "grad_norm": 1.129612684249878, | |
| "learning_rate": 0.00015120000000000002, | |
| "loss": 0.10711104869842529, | |
| "mean_token_accuracy": 0.9698869682848453, | |
| "num_tokens": 1208095.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.09287996906787158, | |
| "epoch": 0.4001000250062516, | |
| "grad_norm": 0.6177782416343689, | |
| "learning_rate": 0.00015920000000000002, | |
| "loss": 0.08630093932151794, | |
| "mean_token_accuracy": 0.977255067974329, | |
| "num_tokens": 1273403.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.0744264661334455, | |
| "epoch": 0.42010502625656415, | |
| "grad_norm": 0.766137957572937, | |
| "learning_rate": 0.0001672, | |
| "loss": 0.07393635511398315, | |
| "mean_token_accuracy": 0.9792576834559441, | |
| "num_tokens": 1334848.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.10690853425767273, | |
| "epoch": 0.4401100275068767, | |
| "grad_norm": 0.6585826277732849, | |
| "learning_rate": 0.0001752, | |
| "loss": 0.09994233846664428, | |
| "mean_token_accuracy": 0.972873219102621, | |
| "num_tokens": 1400976.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.06925062141381204, | |
| "epoch": 0.4601150287571893, | |
| "grad_norm": 0.7318869233131409, | |
| "learning_rate": 0.0001832, | |
| "loss": 0.06631548404693603, | |
| "mean_token_accuracy": 0.9832681395113468, | |
| "num_tokens": 1462530.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.08352572850417346, | |
| "epoch": 0.48012003000750186, | |
| "grad_norm": 0.46499672532081604, | |
| "learning_rate": 0.0001912, | |
| "loss": 0.09161096215248107, | |
| "mean_token_accuracy": 0.9757984310388566, | |
| "num_tokens": 1523663.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.06921031260862946, | |
| "epoch": 0.5001250312578145, | |
| "grad_norm": 0.6253766417503357, | |
| "learning_rate": 0.00019920000000000002, | |
| "loss": 0.05958831310272217, | |
| "mean_token_accuracy": 0.982395163923502, | |
| "num_tokens": 1588657.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.06543620774755254, | |
| "epoch": 0.5201300325081271, | |
| "grad_norm": 0.6349820494651794, | |
| "learning_rate": 0.00019999822839757118, | |
| "loss": 0.06900651454925537, | |
| "mean_token_accuracy": 0.9801992796361446, | |
| "num_tokens": 1653260.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.06953847317490727, | |
| "epoch": 0.5401350337584396, | |
| "grad_norm": 0.6046717166900635, | |
| "learning_rate": 0.00019999210442038162, | |
| "loss": 0.06709518432617187, | |
| "mean_token_accuracy": 0.9797540627419948, | |
| "num_tokens": 1718687.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.08993639135733247, | |
| "epoch": 0.5601400350087522, | |
| "grad_norm": 0.7929577231407166, | |
| "learning_rate": 0.00019998160646461522, | |
| "loss": 0.09603813290596008, | |
| "mean_token_accuracy": 0.9745012931525707, | |
| "num_tokens": 1779338.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.06307904429268092, | |
| "epoch": 0.5801450362590648, | |
| "grad_norm": 0.3916383683681488, | |
| "learning_rate": 0.00019996673498948658, | |
| "loss": 0.06412749290466309, | |
| "mean_token_accuracy": 0.9828441753983498, | |
| "num_tokens": 1842872.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.05729433842934668, | |
| "epoch": 0.6001500375093773, | |
| "grad_norm": 0.38883084058761597, | |
| "learning_rate": 0.00019994749064552214, | |
| "loss": 0.051730161905288695, | |
| "mean_token_accuracy": 0.9857619300484657, | |
| "num_tokens": 1904154.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.03964498438872397, | |
| "epoch": 0.6201550387596899, | |
| "grad_norm": 0.6382091045379639, | |
| "learning_rate": 0.0001999238742745319, | |
| "loss": 0.042625024914741516, | |
| "mean_token_accuracy": 0.9874393172562123, | |
| "num_tokens": 1966060.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.05733265266753733, | |
| "epoch": 0.6401600400100025, | |
| "grad_norm": 0.6905948519706726, | |
| "learning_rate": 0.00019989588690957249, | |
| "loss": 0.06732727885246277, | |
| "mean_token_accuracy": 0.982555440813303, | |
| "num_tokens": 2031939.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.07143733124248683, | |
| "epoch": 0.660165041260315, | |
| "grad_norm": 0.4337286949157715, | |
| "learning_rate": 0.0001998635297749018, | |
| "loss": 0.058036553859710696, | |
| "mean_token_accuracy": 0.9844090364873409, | |
| "num_tokens": 2095271.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.04944599290611222, | |
| "epoch": 0.6801700425106276, | |
| "grad_norm": 0.3526521921157837, | |
| "learning_rate": 0.00019982680428592584, | |
| "loss": 0.053340816497802736, | |
| "mean_token_accuracy": 0.9839612312614918, | |
| "num_tokens": 2158321.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.06322509178426117, | |
| "epoch": 0.7001750437609402, | |
| "grad_norm": 0.5422689318656921, | |
| "learning_rate": 0.00019978571204913638, | |
| "loss": 0.051858377456665036, | |
| "mean_token_accuracy": 0.9867838315665722, | |
| "num_tokens": 2225062.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.046866965352091935, | |
| "epoch": 0.7201800450112528, | |
| "grad_norm": 0.7101793885231018, | |
| "learning_rate": 0.000199740254862041, | |
| "loss": 0.05608519911766052, | |
| "mean_token_accuracy": 0.9851541951298713, | |
| "num_tokens": 2291157.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.06618997184559702, | |
| "epoch": 0.7401850462615653, | |
| "grad_norm": 0.6186705827713013, | |
| "learning_rate": 0.00019969043471308436, | |
| "loss": 0.056741136312484744, | |
| "mean_token_accuracy": 0.9844918318092823, | |
| "num_tokens": 2353621.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.052203354140510784, | |
| "epoch": 0.760190047511878, | |
| "grad_norm": 0.9665183424949646, | |
| "learning_rate": 0.00019963625378156114, | |
| "loss": 0.05278732180595398, | |
| "mean_token_accuracy": 0.9863728702068328, | |
| "num_tokens": 2415518.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.04799637275282294, | |
| "epoch": 0.7801950487621906, | |
| "grad_norm": 0.45738333463668823, | |
| "learning_rate": 0.00019957771443752083, | |
| "loss": 0.044900187849998476, | |
| "mean_token_accuracy": 0.9872696734964848, | |
| "num_tokens": 2477716.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.045062902639620005, | |
| "epoch": 0.8002000500125032, | |
| "grad_norm": 0.4040285646915436, | |
| "learning_rate": 0.00019951481924166396, | |
| "loss": 0.043438228964805606, | |
| "mean_token_accuracy": 0.9878960207104683, | |
| "num_tokens": 2540807.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.036265855759847906, | |
| "epoch": 0.8202050512628157, | |
| "grad_norm": 0.4411618411540985, | |
| "learning_rate": 0.0001994475709452301, | |
| "loss": 0.04615793526172638, | |
| "mean_token_accuracy": 0.9870041370391845, | |
| "num_tokens": 2603019.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.05851077587576583, | |
| "epoch": 0.8402100525131283, | |
| "grad_norm": 0.31862467527389526, | |
| "learning_rate": 0.0001993759724898777, | |
| "loss": 0.045778676867485046, | |
| "mean_token_accuracy": 0.9873291261494159, | |
| "num_tokens": 2667216.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.03860169492545538, | |
| "epoch": 0.8602150537634409, | |
| "grad_norm": 0.29344919323921204, | |
| "learning_rate": 0.00019930002700755507, | |
| "loss": 0.03828286230564117, | |
| "mean_token_accuracy": 0.988411296159029, | |
| "num_tokens": 2729805.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.03951184251927771, | |
| "epoch": 0.8802200550137534, | |
| "grad_norm": 0.4283672571182251, | |
| "learning_rate": 0.00019921973782036366, | |
| "loss": 0.038545310497283936, | |
| "mean_token_accuracy": 0.9878928653895855, | |
| "num_tokens": 2793292.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.028071055363398045, | |
| "epoch": 0.900225056264066, | |
| "grad_norm": 0.7173567414283752, | |
| "learning_rate": 0.0001991351084404126, | |
| "loss": 0.03233465254306793, | |
| "mean_token_accuracy": 0.9912850938737392, | |
| "num_tokens": 2855909.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.04781279567687306, | |
| "epoch": 0.9202300575143786, | |
| "grad_norm": 0.3380762040615082, | |
| "learning_rate": 0.00019904614256966512, | |
| "loss": 0.040875044465065, | |
| "mean_token_accuracy": 0.9889427930116653, | |
| "num_tokens": 2916597.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.045654052757890896, | |
| "epoch": 0.9402350587646912, | |
| "grad_norm": 0.21747978031635284, | |
| "learning_rate": 0.0001989528440997767, | |
| "loss": 0.04227911233901978, | |
| "mean_token_accuracy": 0.987830163538456, | |
| "num_tokens": 2977012.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.039897680119611326, | |
| "epoch": 0.9602400600150037, | |
| "grad_norm": 0.3250534236431122, | |
| "learning_rate": 0.00019885521711192453, | |
| "loss": 0.03866271674633026, | |
| "mean_token_accuracy": 0.9888145305216313, | |
| "num_tokens": 3039866.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.0344677664746996, | |
| "epoch": 0.9802450612653163, | |
| "grad_norm": 0.5867555141448975, | |
| "learning_rate": 0.00019875326587662941, | |
| "loss": 0.030780380964279173, | |
| "mean_token_accuracy": 0.9910528786480427, | |
| "num_tokens": 3102450.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.03601513006665473, | |
| "epoch": 1.0, | |
| "grad_norm": 0.19166764616966248, | |
| "learning_rate": 0.00019864699485356866, | |
| "loss": 0.04189955592155457, | |
| "mean_token_accuracy": 0.989976388744161, | |
| "num_tokens": 3162838.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 0.051686967685315256, | |
| "eval_loss": 0.04872545599937439, | |
| "eval_mean_token_accuracy": 0.9849747346865164, | |
| "eval_num_tokens": 3162838.0, | |
| "eval_runtime": 69.4136, | |
| "eval_samples_per_second": 14.911, | |
| "eval_steps_per_second": 7.463, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.04407569046597928, | |
| "epoch": 1.0200050012503126, | |
| "grad_norm": 0.2645007371902466, | |
| "learning_rate": 0.00019853640869138103, | |
| "loss": 0.03468368649482727, | |
| "mean_token_accuracy": 0.990016209334135, | |
| "num_tokens": 3228763.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.035535094334045426, | |
| "epoch": 1.0400100025006251, | |
| "grad_norm": 0.40270644426345825, | |
| "learning_rate": 0.00019842151222746357, | |
| "loss": 0.03389493525028229, | |
| "mean_token_accuracy": 0.9887583516538143, | |
| "num_tokens": 3293010.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.028601143200648948, | |
| "epoch": 1.0600150037509377, | |
| "grad_norm": 0.2681713104248047, | |
| "learning_rate": 0.00019830231048775977, | |
| "loss": 0.030898410081863403, | |
| "mean_token_accuracy": 0.9903686709702015, | |
| "num_tokens": 3354919.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.034907517378451304, | |
| "epoch": 1.0800200050012503, | |
| "grad_norm": 0.23451267182826996, | |
| "learning_rate": 0.00019817880868653993, | |
| "loss": 0.03407395482063293, | |
| "mean_token_accuracy": 0.9890573389828206, | |
| "num_tokens": 3415784.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.033313815778819846, | |
| "epoch": 1.1000250062515629, | |
| "grad_norm": 0.23950988054275513, | |
| "learning_rate": 0.0001980510122261729, | |
| "loss": 0.029421544075012206, | |
| "mean_token_accuracy": 0.9916689246892929, | |
| "num_tokens": 3480364.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.02486751726246439, | |
| "epoch": 1.1200300075018754, | |
| "grad_norm": 0.4551165997982025, | |
| "learning_rate": 0.00019791892669688988, | |
| "loss": 0.020369285345077516, | |
| "mean_token_accuracy": 0.9940513521432877, | |
| "num_tokens": 3542678.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.029150180192664264, | |
| "epoch": 1.140035008752188, | |
| "grad_norm": 0.20443572103977203, | |
| "learning_rate": 0.00019778255787653978, | |
| "loss": 0.02770337164402008, | |
| "mean_token_accuracy": 0.9897698886692524, | |
| "num_tokens": 3609086.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.031121585314394906, | |
| "epoch": 1.1600400100025006, | |
| "grad_norm": 0.3653818368911743, | |
| "learning_rate": 0.00019764191173033663, | |
| "loss": 0.025546741485595704, | |
| "mean_token_accuracy": 0.9925875566899777, | |
| "num_tokens": 3670310.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.02902457951568067, | |
| "epoch": 1.1800450112528131, | |
| "grad_norm": 0.4811317026615143, | |
| "learning_rate": 0.00019749699441059843, | |
| "loss": 0.027299800515174867, | |
| "mean_token_accuracy": 0.9906462356448174, | |
| "num_tokens": 3735307.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.030135014103143475, | |
| "epoch": 1.2000500125031257, | |
| "grad_norm": 0.21709105372428894, | |
| "learning_rate": 0.00019734781225647828, | |
| "loss": 0.02665548324584961, | |
| "mean_token_accuracy": 0.9932463668286801, | |
| "num_tokens": 3797213.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.03371675145754125, | |
| "epoch": 1.2200550137534383, | |
| "grad_norm": 0.631148636341095, | |
| "learning_rate": 0.00019719437179368688, | |
| "loss": 0.03535972833633423, | |
| "mean_token_accuracy": 0.9895499177277088, | |
| "num_tokens": 3859400.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.028748418507166206, | |
| "epoch": 1.2400600150037508, | |
| "grad_norm": 0.42123743891716003, | |
| "learning_rate": 0.00019703667973420706, | |
| "loss": 0.027658408880233763, | |
| "mean_token_accuracy": 0.9910015679895878, | |
| "num_tokens": 3920848.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.029886699473718182, | |
| "epoch": 1.2600650162540634, | |
| "grad_norm": 0.23473748564720154, | |
| "learning_rate": 0.00019687474297600045, | |
| "loss": 0.028230640292167663, | |
| "mean_token_accuracy": 0.9922301307320595, | |
| "num_tokens": 3984529.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.03151440276997164, | |
| "epoch": 1.280070017504376, | |
| "grad_norm": 0.2611916661262512, | |
| "learning_rate": 0.00019670856860270542, | |
| "loss": 0.027012214064598083, | |
| "mean_token_accuracy": 0.9917375601828098, | |
| "num_tokens": 4048411.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.027149295064737088, | |
| "epoch": 1.3000750187546886, | |
| "grad_norm": 0.12378375232219696, | |
| "learning_rate": 0.0001965381638833274, | |
| "loss": 0.023584455251693726, | |
| "mean_token_accuracy": 0.9936468034982682, | |
| "num_tokens": 4112116.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.028390987019520253, | |
| "epoch": 1.3200800200050011, | |
| "grad_norm": 0.18841037154197693, | |
| "learning_rate": 0.00019636353627192082, | |
| "loss": 0.025832393765449525, | |
| "mean_token_accuracy": 0.9933209784328938, | |
| "num_tokens": 4175458.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.032682666774780954, | |
| "epoch": 1.3400850212553137, | |
| "grad_norm": 0.292369544506073, | |
| "learning_rate": 0.00019618469340726319, | |
| "loss": 0.032191649079322815, | |
| "mean_token_accuracy": 0.9895716637372971, | |
| "num_tokens": 4236466.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.032574003856279884, | |
| "epoch": 1.3600900225056263, | |
| "grad_norm": 0.2205415517091751, | |
| "learning_rate": 0.00019600164311252068, | |
| "loss": 0.02866535782814026, | |
| "mean_token_accuracy": 0.991417796164751, | |
| "num_tokens": 4299775.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.04169052811048459, | |
| "epoch": 1.380095023755939, | |
| "grad_norm": 0.3276292681694031, | |
| "learning_rate": 0.00019581439339490624, | |
| "loss": 0.03524776101112366, | |
| "mean_token_accuracy": 0.9886757604777813, | |
| "num_tokens": 4365609.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.03188371795695275, | |
| "epoch": 1.4001000250062516, | |
| "grad_norm": 0.4103780686855316, | |
| "learning_rate": 0.0001956229524453291, | |
| "loss": 0.035996857285499576, | |
| "mean_token_accuracy": 0.9892666183412075, | |
| "num_tokens": 4432330.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.02871296225930564, | |
| "epoch": 1.4201050262565642, | |
| "grad_norm": 0.24775762856006622, | |
| "learning_rate": 0.00019542732863803662, | |
| "loss": 0.02328706532716751, | |
| "mean_token_accuracy": 0.9937438026070595, | |
| "num_tokens": 4496465.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.03388670613931026, | |
| "epoch": 1.4401100275068768, | |
| "grad_norm": 0.25881657004356384, | |
| "learning_rate": 0.00019522753053024787, | |
| "loss": 0.03300818204879761, | |
| "mean_token_accuracy": 0.9890970505774022, | |
| "num_tokens": 4560755.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.03670836841047276, | |
| "epoch": 1.4601150287571893, | |
| "grad_norm": 0.23787066340446472, | |
| "learning_rate": 0.00019502356686177926, | |
| "loss": 0.03214167952537537, | |
| "mean_token_accuracy": 0.9903383336961269, | |
| "num_tokens": 4625202.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.03299383492558263, | |
| "epoch": 1.480120030007502, | |
| "grad_norm": 0.31929901242256165, | |
| "learning_rate": 0.00019481544655466245, | |
| "loss": 0.031187814474105836, | |
| "mean_token_accuracy": 0.9905215993523597, | |
| "num_tokens": 4692174.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.023855643330898603, | |
| "epoch": 1.5001250312578145, | |
| "grad_norm": 0.24006661772727966, | |
| "learning_rate": 0.00019460317871275394, | |
| "loss": 0.025655516982078554, | |
| "mean_token_accuracy": 0.9913376875221729, | |
| "num_tokens": 4753192.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.033190094074234365, | |
| "epoch": 1.520130032508127, | |
| "grad_norm": 0.2834339737892151, | |
| "learning_rate": 0.00019438677262133668, | |
| "loss": 0.03126271665096283, | |
| "mean_token_accuracy": 0.9907064586877823, | |
| "num_tokens": 4817884.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.03176074127841275, | |
| "epoch": 1.5401350337584396, | |
| "grad_norm": 0.4165857136249542, | |
| "learning_rate": 0.00019416623774671425, | |
| "loss": 0.033395078778266904, | |
| "mean_token_accuracy": 0.9902952447533607, | |
| "num_tokens": 4879601.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.03441936054150574, | |
| "epoch": 1.5601400350087522, | |
| "grad_norm": 0.5297831296920776, | |
| "learning_rate": 0.00019394158373579645, | |
| "loss": 0.02917470932006836, | |
| "mean_token_accuracy": 0.9917018190026283, | |
| "num_tokens": 4946026.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.029212182367336935, | |
| "epoch": 1.5801450362590648, | |
| "grad_norm": 0.3761133849620819, | |
| "learning_rate": 0.00019371282041567752, | |
| "loss": 0.02672044336795807, | |
| "mean_token_accuracy": 0.9930847369134426, | |
| "num_tokens": 5009097.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.03556556548574008, | |
| "epoch": 1.6001500375093773, | |
| "grad_norm": 0.2545328438282013, | |
| "learning_rate": 0.0001934799577932062, | |
| "loss": 0.0338908702135086, | |
| "mean_token_accuracy": 0.990411739051342, | |
| "num_tokens": 5076314.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.02515874128730502, | |
| "epoch": 1.62015503875969, | |
| "grad_norm": 0.3428667187690735, | |
| "learning_rate": 0.0001932430060545479, | |
| "loss": 0.022386419773101806, | |
| "mean_token_accuracy": 0.9932228110730648, | |
| "num_tokens": 5135522.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.021622967024450192, | |
| "epoch": 1.6401600400100025, | |
| "grad_norm": 0.19730041921138763, | |
| "learning_rate": 0.00019300197556473936, | |
| "loss": 0.02211230844259262, | |
| "mean_token_accuracy": 0.993052315711975, | |
| "num_tokens": 5198651.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.022755468662944624, | |
| "epoch": 1.660165041260315, | |
| "grad_norm": 0.24043497443199158, | |
| "learning_rate": 0.00019275687686723497, | |
| "loss": 0.021593029797077178, | |
| "mean_token_accuracy": 0.9927247293293476, | |
| "num_tokens": 5258441.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.02988760783628095, | |
| "epoch": 1.6801700425106276, | |
| "grad_norm": 0.22126108407974243, | |
| "learning_rate": 0.0001925077206834458, | |
| "loss": 0.02743455469608307, | |
| "mean_token_accuracy": 0.9924947433173656, | |
| "num_tokens": 5323635.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.022633779112948105, | |
| "epoch": 1.7001750437609402, | |
| "grad_norm": 0.2528051435947418, | |
| "learning_rate": 0.00019225451791227052, | |
| "loss": 0.01915370374917984, | |
| "mean_token_accuracy": 0.9935295671224594, | |
| "num_tokens": 5388098.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.024347139010205864, | |
| "epoch": 1.7201800450112528, | |
| "grad_norm": 0.35426992177963257, | |
| "learning_rate": 0.00019199727962961852, | |
| "loss": 0.025216898322105406, | |
| "mean_token_accuracy": 0.9927972495555878, | |
| "num_tokens": 5450303.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.02343553317186888, | |
| "epoch": 1.7401850462615653, | |
| "grad_norm": 0.2603664994239807, | |
| "learning_rate": 0.00019173601708792566, | |
| "loss": 0.022424712777137756, | |
| "mean_token_accuracy": 0.9926920354366302, | |
| "num_tokens": 5513723.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.03952418522676453, | |
| "epoch": 1.7601900475118781, | |
| "grad_norm": 0.21528302133083344, | |
| "learning_rate": 0.0001914707417156619, | |
| "loss": 0.03777352273464203, | |
| "mean_token_accuracy": 0.9895162962377071, | |
| "num_tokens": 5575942.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.037056630512233825, | |
| "epoch": 1.7801950487621907, | |
| "grad_norm": 0.39761167764663696, | |
| "learning_rate": 0.00019120146511683142, | |
| "loss": 0.02916957139968872, | |
| "mean_token_accuracy": 0.9906649015843868, | |
| "num_tokens": 5640243.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.022086267481790857, | |
| "epoch": 1.8002000500125033, | |
| "grad_norm": 0.43694376945495605, | |
| "learning_rate": 0.00019092819907046493, | |
| "loss": 0.023631574213504793, | |
| "mean_token_accuracy": 0.9936031945049763, | |
| "num_tokens": 5702162.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.028572715594782493, | |
| "epoch": 1.8202050512628158, | |
| "grad_norm": 0.4214474558830261, | |
| "learning_rate": 0.00019065095553010458, | |
| "loss": 0.025940075516700745, | |
| "mean_token_accuracy": 0.9905624501407146, | |
| "num_tokens": 5764127.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.028239472245331854, | |
| "epoch": 1.8402100525131284, | |
| "grad_norm": 0.40316465497016907, | |
| "learning_rate": 0.00019036974662328096, | |
| "loss": 0.027613845467567445, | |
| "mean_token_accuracy": 0.991669587045908, | |
| "num_tokens": 5827235.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.028241146955406294, | |
| "epoch": 1.860215053763441, | |
| "grad_norm": 0.524972677230835, | |
| "learning_rate": 0.0001900845846509827, | |
| "loss": 0.03177001476287842, | |
| "mean_token_accuracy": 0.9903169378638268, | |
| "num_tokens": 5890040.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.03260187199921347, | |
| "epoch": 1.8802200550137536, | |
| "grad_norm": 0.43904051184654236, | |
| "learning_rate": 0.00018979548208711817, | |
| "loss": 0.02139996737241745, | |
| "mean_token_accuracy": 0.9935068063437938, | |
| "num_tokens": 5953149.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.025593279630993494, | |
| "epoch": 1.9002250562640661, | |
| "grad_norm": 0.25154390931129456, | |
| "learning_rate": 0.00018950245157797014, | |
| "loss": 0.02489333599805832, | |
| "mean_token_accuracy": 0.9933448024094105, | |
| "num_tokens": 6014655.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.025231685642211232, | |
| "epoch": 1.9202300575143787, | |
| "grad_norm": 0.2318635731935501, | |
| "learning_rate": 0.00018920550594164238, | |
| "loss": 0.02543329894542694, | |
| "mean_token_accuracy": 0.9929649449884892, | |
| "num_tokens": 6078667.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.0415392193797743, | |
| "epoch": 1.9402350587646913, | |
| "grad_norm": 0.2020518183708191, | |
| "learning_rate": 0.00018890465816749896, | |
| "loss": 0.03582499623298645, | |
| "mean_token_accuracy": 0.9897747471928596, | |
| "num_tokens": 6139688.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.026439224516798275, | |
| "epoch": 1.9602400600150038, | |
| "grad_norm": 0.25302180647850037, | |
| "learning_rate": 0.00018859992141559615, | |
| "loss": 0.023522551357746124, | |
| "mean_token_accuracy": 0.9931276544928551, | |
| "num_tokens": 6203193.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.02257391346647637, | |
| "epoch": 1.9802450612653164, | |
| "grad_norm": 0.37129050493240356, | |
| "learning_rate": 0.00018829130901610667, | |
| "loss": 0.023089873790740966, | |
| "mean_token_accuracy": 0.9930807471275329, | |
| "num_tokens": 6265353.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.024826381788765894, | |
| "epoch": 2.0, | |
| "grad_norm": 0.1416839361190796, | |
| "learning_rate": 0.00018797883446873662, | |
| "loss": 0.020879687368869783, | |
| "mean_token_accuracy": 0.9931328839893583, | |
| "num_tokens": 6325676.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 0.028477752043098808, | |
| "eval_loss": 0.042340315878391266, | |
| "eval_mean_token_accuracy": 0.988268693211456, | |
| "eval_num_tokens": 6325676.0, | |
| "eval_runtime": 69.2562, | |
| "eval_samples_per_second": 14.945, | |
| "eval_steps_per_second": 7.479, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.021088267347658986, | |
| "epoch": 2.0200050012503126, | |
| "grad_norm": 0.33506715297698975, | |
| "learning_rate": 0.00018766251144213504, | |
| "loss": 0.0183292493224144, | |
| "mean_token_accuracy": 0.9939773567020893, | |
| "num_tokens": 6391016.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.021377279089938382, | |
| "epoch": 2.040010002500625, | |
| "grad_norm": 0.10510263592004776, | |
| "learning_rate": 0.00018734235377329582, | |
| "loss": 0.016541089117527007, | |
| "mean_token_accuracy": 0.9943198271095752, | |
| "num_tokens": 6455040.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.01835900279111229, | |
| "epoch": 2.0600150037509377, | |
| "grad_norm": 0.25538530945777893, | |
| "learning_rate": 0.0001870183754669526, | |
| "loss": 0.017676208913326264, | |
| "mean_token_accuracy": 0.9943479098379612, | |
| "num_tokens": 6517983.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.024707998137455434, | |
| "epoch": 2.0800200050012503, | |
| "grad_norm": 0.1953907310962677, | |
| "learning_rate": 0.00018669059069496594, | |
| "loss": 0.018231543898582458, | |
| "mean_token_accuracy": 0.9940299488604069, | |
| "num_tokens": 6582155.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.016339628079731484, | |
| "epoch": 2.100025006251563, | |
| "grad_norm": 0.23519866168498993, | |
| "learning_rate": 0.00018635901379570377, | |
| "loss": 0.015705856680870055, | |
| "mean_token_accuracy": 0.9944866336882114, | |
| "num_tokens": 6644403.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.021186151236179285, | |
| "epoch": 2.1200300075018754, | |
| "grad_norm": 0.7782704830169678, | |
| "learning_rate": 0.00018602365927341375, | |
| "loss": 0.0239964097738266, | |
| "mean_token_accuracy": 0.9942199148237705, | |
| "num_tokens": 6709057.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.02400836138986051, | |
| "epoch": 2.140035008752188, | |
| "grad_norm": 0.25117242336273193, | |
| "learning_rate": 0.0001856845417975891, | |
| "loss": 0.0214329332113266, | |
| "mean_token_accuracy": 0.99395372569561, | |
| "num_tokens": 6772040.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.01854798578133341, | |
| "epoch": 2.1600400100025006, | |
| "grad_norm": 0.24927817285060883, | |
| "learning_rate": 0.0001853416762023268, | |
| "loss": 0.01707075983285904, | |
| "mean_token_accuracy": 0.9950113117694854, | |
| "num_tokens": 6835866.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.019260429358109833, | |
| "epoch": 2.180045011252813, | |
| "grad_norm": 0.24353672564029694, | |
| "learning_rate": 0.00018499507748567873, | |
| "loss": 0.014785376191139222, | |
| "mean_token_accuracy": 0.9959283553063869, | |
| "num_tokens": 6899725.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.02487965851032641, | |
| "epoch": 2.2000500125031257, | |
| "grad_norm": 0.288215309381485, | |
| "learning_rate": 0.00018464476080899559, | |
| "loss": 0.019350311160087584, | |
| "mean_token_accuracy": 0.9941258184611798, | |
| "num_tokens": 6963141.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.01580278711626306, | |
| "epoch": 2.2200550137534383, | |
| "grad_norm": 0.0646059513092041, | |
| "learning_rate": 0.00018429074149626363, | |
| "loss": 0.017427970468997956, | |
| "mean_token_accuracy": 0.9952689491212368, | |
| "num_tokens": 7028325.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.020199327028240077, | |
| "epoch": 2.240060015003751, | |
| "grad_norm": 0.160948246717453, | |
| "learning_rate": 0.0001839330350334345, | |
| "loss": 0.01726052612066269, | |
| "mean_token_accuracy": 0.9933249458670617, | |
| "num_tokens": 7092920.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.021389624777657445, | |
| "epoch": 2.2600650162540634, | |
| "grad_norm": 0.2359917163848877, | |
| "learning_rate": 0.00018357165706774767, | |
| "loss": 0.01608244627714157, | |
| "mean_token_accuracy": 0.9940837919712067, | |
| "num_tokens": 7160997.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.02022790874907514, | |
| "epoch": 2.280070017504376, | |
| "grad_norm": 0.07118914276361465, | |
| "learning_rate": 0.00018320662340704609, | |
| "loss": 0.020376379787921905, | |
| "mean_token_accuracy": 0.9942706093192101, | |
| "num_tokens": 7226007.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.01867675751855131, | |
| "epoch": 2.3000750187546886, | |
| "grad_norm": 0.25310513377189636, | |
| "learning_rate": 0.00018283795001908457, | |
| "loss": 0.01612715721130371, | |
| "mean_token_accuracy": 0.9942055746912957, | |
| "num_tokens": 7287986.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.015577676898101345, | |
| "epoch": 2.320080020005001, | |
| "grad_norm": 0.2142266184091568, | |
| "learning_rate": 0.0001824656530308315, | |
| "loss": 0.016605789959430694, | |
| "mean_token_accuracy": 0.9948085315525532, | |
| "num_tokens": 7349421.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.020357475349737798, | |
| "epoch": 2.3400850212553137, | |
| "grad_norm": 0.07947535812854767, | |
| "learning_rate": 0.00018208974872776322, | |
| "loss": 0.018196111917495726, | |
| "mean_token_accuracy": 0.993843074887991, | |
| "num_tokens": 7411941.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.017023067966511006, | |
| "epoch": 2.3600900225056263, | |
| "grad_norm": 0.19202570617198944, | |
| "learning_rate": 0.00018171025355315164, | |
| "loss": 0.016091108322143555, | |
| "mean_token_accuracy": 0.9953217662870883, | |
| "num_tokens": 7474356.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.01825423450791277, | |
| "epoch": 2.380095023755939, | |
| "grad_norm": 0.24460658431053162, | |
| "learning_rate": 0.00018132718410734515, | |
| "loss": 0.015425822138786316, | |
| "mean_token_accuracy": 0.9943965286016464, | |
| "num_tokens": 7536565.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.015542891589575447, | |
| "epoch": 2.4001000250062514, | |
| "grad_norm": 0.24659694731235504, | |
| "learning_rate": 0.00018094055714704225, | |
| "loss": 0.013514925539493561, | |
| "mean_token_accuracy": 0.9943179704248906, | |
| "num_tokens": 7599751.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.015307287167524919, | |
| "epoch": 2.420105026256564, | |
| "grad_norm": 0.2550601065158844, | |
| "learning_rate": 0.0001805503895845587, | |
| "loss": 0.012726837396621704, | |
| "mean_token_accuracy": 0.9962130591273308, | |
| "num_tokens": 7661520.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.01749844834121177, | |
| "epoch": 2.4401100275068766, | |
| "grad_norm": 0.15603283047676086, | |
| "learning_rate": 0.00018015669848708767, | |
| "loss": 0.012257835268974305, | |
| "mean_token_accuracy": 0.9954387851059436, | |
| "num_tokens": 7726291.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.019737370508664753, | |
| "epoch": 2.460115028757189, | |
| "grad_norm": 0.22746174037456512, | |
| "learning_rate": 0.0001797595010759531, | |
| "loss": 0.018561355769634247, | |
| "mean_token_accuracy": 0.9940820440649987, | |
| "num_tokens": 7788766.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.015929855390277227, | |
| "epoch": 2.4801200300075017, | |
| "grad_norm": 0.3152976334095001, | |
| "learning_rate": 0.0001793588147258565, | |
| "loss": 0.013849316537380219, | |
| "mean_token_accuracy": 0.9952766291797162, | |
| "num_tokens": 7851396.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.02108022033935413, | |
| "epoch": 2.5001250312578147, | |
| "grad_norm": 0.2762889862060547, | |
| "learning_rate": 0.00017895465696411692, | |
| "loss": 0.019299986958503722, | |
| "mean_token_accuracy": 0.9940553769469261, | |
| "num_tokens": 7915421.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.020866505106096157, | |
| "epoch": 2.520130032508127, | |
| "grad_norm": 0.24086585640907288, | |
| "learning_rate": 0.00017854704546990408, | |
| "loss": 0.020875005424022673, | |
| "mean_token_accuracy": 0.9940896175801754, | |
| "num_tokens": 7977133.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.020857046739547514, | |
| "epoch": 2.54013503375844, | |
| "grad_norm": 0.23781460523605347, | |
| "learning_rate": 0.0001781359980734653, | |
| "loss": 0.018643879890441896, | |
| "mean_token_accuracy": 0.9929048053920269, | |
| "num_tokens": 8040191.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.021198420476866885, | |
| "epoch": 2.560140035008752, | |
| "grad_norm": 0.2054099142551422, | |
| "learning_rate": 0.0001777215327553452, | |
| "loss": 0.017947974801063537, | |
| "mean_token_accuracy": 0.9934561550617218, | |
| "num_tokens": 8100152.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.018285114454920405, | |
| "epoch": 2.580145036259065, | |
| "grad_norm": 0.469458669424057, | |
| "learning_rate": 0.00017730366764559955, | |
| "loss": 0.0151192307472229, | |
| "mean_token_accuracy": 0.9951836079359054, | |
| "num_tokens": 8162591.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.018374070005665998, | |
| "epoch": 2.600150037509377, | |
| "grad_norm": 0.2882782518863678, | |
| "learning_rate": 0.00017688242102300192, | |
| "loss": 0.0184975802898407, | |
| "mean_token_accuracy": 0.9948060251772404, | |
| "num_tokens": 8225224.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.022974171601526906, | |
| "epoch": 2.62015503875969, | |
| "grad_norm": 0.21924524009227753, | |
| "learning_rate": 0.00017645781131424423, | |
| "loss": 0.023296315968036652, | |
| "mean_token_accuracy": 0.9924322210252285, | |
| "num_tokens": 8290274.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.02169415617827326, | |
| "epoch": 2.6401600400100023, | |
| "grad_norm": 0.354758620262146, | |
| "learning_rate": 0.00017602985709313073, | |
| "loss": 0.017917373776435853, | |
| "mean_token_accuracy": 0.9948078036308289, | |
| "num_tokens": 8354370.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.016268294051405972, | |
| "epoch": 2.6601650412603153, | |
| "grad_norm": 0.4151551127433777, | |
| "learning_rate": 0.00017559857707976536, | |
| "loss": 0.012286465615034103, | |
| "mean_token_accuracy": 0.9961770802736283, | |
| "num_tokens": 8415022.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.0170176492218161, | |
| "epoch": 2.6801700425106274, | |
| "grad_norm": 0.4065402150154114, | |
| "learning_rate": 0.0001751639901397331, | |
| "loss": 0.01499750316143036, | |
| "mean_token_accuracy": 0.9952280893921852, | |
| "num_tokens": 8478286.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.018367627350380646, | |
| "epoch": 2.7001750437609404, | |
| "grad_norm": 0.1335880309343338, | |
| "learning_rate": 0.0001747261152832746, | |
| "loss": 0.015018537640571594, | |
| "mean_token_accuracy": 0.9949840374290944, | |
| "num_tokens": 8541154.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.019403737914399245, | |
| "epoch": 2.7201800450112525, | |
| "grad_norm": 0.20553363859653473, | |
| "learning_rate": 0.00017428497166445452, | |
| "loss": 0.019237272441387177, | |
| "mean_token_accuracy": 0.9930156201124192, | |
| "num_tokens": 8605361.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.02298831292137038, | |
| "epoch": 2.7401850462615656, | |
| "grad_norm": 0.31576329469680786, | |
| "learning_rate": 0.00017384057858032393, | |
| "loss": 0.019147740304470064, | |
| "mean_token_accuracy": 0.9930574476718903, | |
| "num_tokens": 8669155.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.01718737747578416, | |
| "epoch": 2.760190047511878, | |
| "grad_norm": 0.21389739215373993, | |
| "learning_rate": 0.00017339295547007594, | |
| "loss": 0.017152118682861327, | |
| "mean_token_accuracy": 0.995334691554308, | |
| "num_tokens": 8735019.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.019683032816101332, | |
| "epoch": 2.7801950487621907, | |
| "grad_norm": 0.26539650559425354, | |
| "learning_rate": 0.00017294212191419547, | |
| "loss": 0.019429606199264527, | |
| "mean_token_accuracy": 0.9936951123178005, | |
| "num_tokens": 8800972.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.018636453218641692, | |
| "epoch": 2.8002000500125033, | |
| "grad_norm": 0.2084941565990448, | |
| "learning_rate": 0.00017248809763360277, | |
| "loss": 0.01909356415271759, | |
| "mean_token_accuracy": 0.9940625011920929, | |
| "num_tokens": 8867596.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.023316194582730532, | |
| "epoch": 2.820205051262816, | |
| "grad_norm": 0.21403200924396515, | |
| "learning_rate": 0.0001720309024887907, | |
| "loss": 0.018046848475933075, | |
| "mean_token_accuracy": 0.9939217306673527, | |
| "num_tokens": 8927516.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.01655098560877377, | |
| "epoch": 2.8402100525131284, | |
| "grad_norm": 0.33148443698883057, | |
| "learning_rate": 0.000171570556478956, | |
| "loss": 0.018755699694156646, | |
| "mean_token_accuracy": 0.9942230053246022, | |
| "num_tokens": 8989089.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.02549898542056326, | |
| "epoch": 2.860215053763441, | |
| "grad_norm": 0.18521511554718018, | |
| "learning_rate": 0.00017110707974112447, | |
| "loss": 0.024141687154769897, | |
| "mean_token_accuracy": 0.9930150359869003, | |
| "num_tokens": 9054435.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.01900827525241766, | |
| "epoch": 2.8802200550137536, | |
| "grad_norm": 0.23067928850650787, | |
| "learning_rate": 0.0001706404925492701, | |
| "loss": 0.020157690346240997, | |
| "mean_token_accuracy": 0.9943146407604218, | |
| "num_tokens": 9114274.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.01623811650206335, | |
| "epoch": 2.900225056264066, | |
| "grad_norm": 0.5235961079597473, | |
| "learning_rate": 0.00017017081531342813, | |
| "loss": 0.014147150516510009, | |
| "mean_token_accuracy": 0.9944271765649318, | |
| "num_tokens": 9174841.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.023971330239146483, | |
| "epoch": 2.9202300575143787, | |
| "grad_norm": 0.11377973109483719, | |
| "learning_rate": 0.00016969806857880241, | |
| "loss": 0.022856634855270386, | |
| "mean_token_accuracy": 0.9932261377573013, | |
| "num_tokens": 9239456.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.02552748184389202, | |
| "epoch": 2.9402350587646913, | |
| "grad_norm": 0.12835904955863953, | |
| "learning_rate": 0.00016922227302486667, | |
| "loss": 0.02486345320940018, | |
| "mean_token_accuracy": 0.9918816141784191, | |
| "num_tokens": 9305144.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.019867337332107125, | |
| "epoch": 2.960240060015004, | |
| "grad_norm": 0.18033206462860107, | |
| "learning_rate": 0.00016874344946445974, | |
| "loss": 0.018220885097980498, | |
| "mean_token_accuracy": 0.9945706635713577, | |
| "num_tokens": 9365854.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.01948691344150575, | |
| "epoch": 2.9802450612653164, | |
| "grad_norm": 0.2495020180940628, | |
| "learning_rate": 0.00016826161884287533, | |
| "loss": 0.01618766337633133, | |
| "mean_token_accuracy": 0.9956672258675099, | |
| "num_tokens": 9427287.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.022937397798228586, | |
| "epoch": 3.0, | |
| "grad_norm": 0.2727943956851959, | |
| "learning_rate": 0.00016777680223694575, | |
| "loss": 0.024902991950511932, | |
| "mean_token_accuracy": 0.9909723401069641, | |
| "num_tokens": 9488514.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_entropy": 0.02839457441272365, | |
| "eval_loss": 0.03645886108279228, | |
| "eval_mean_token_accuracy": 0.9902446437986661, | |
| "eval_num_tokens": 9488514.0, | |
| "eval_runtime": 69.2921, | |
| "eval_samples_per_second": 14.937, | |
| "eval_steps_per_second": 7.476, | |
| "step": 1500 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.1295589576933376e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |