aiAI_coder_V1.4B / trainer_state.json
wefamm's picture
Upload folder using huggingface_hub
57ded2c verified
Raw History Blame Contribute Delete
20.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 315,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01591723040191007,
"grad_norm": 0.5680273771286011,
"learning_rate": 4.998010925565448e-05,
"loss": 0.722562837600708,
"num_input_tokens_seen": 18800,
"step": 5,
"train_runtime": 39.8867,
"train_tokens_per_second": 471.335
},
{
"epoch": 0.03183446080382014,
"grad_norm": 0.5171770453453064,
"learning_rate": 4.989935734988098e-05,
"loss": 0.2945201873779297,
"num_input_tokens_seen": 37088,
"step": 10,
"train_runtime": 77.9226,
"train_tokens_per_second": 475.959
},
{
"epoch": 0.0477516912057302,
"grad_norm": 0.26242855191230774,
"learning_rate": 4.975670171853926e-05,
"loss": 0.17604056596755982,
"num_input_tokens_seen": 55072,
"step": 15,
"train_runtime": 115.5379,
"train_tokens_per_second": 476.657
},
{
"epoch": 0.06366892160764027,
"grad_norm": 0.31670883297920227,
"learning_rate": 4.9552497026005974e-05,
"loss": 0.11049227714538574,
"num_input_tokens_seen": 73632,
"step": 20,
"train_runtime": 153.8933,
"train_tokens_per_second": 478.461
},
{
"epoch": 0.07958615200955034,
"grad_norm": 0.34576132893562317,
"learning_rate": 4.928725095732169e-05,
"loss": 0.09105676412582397,
"num_input_tokens_seen": 92480,
"step": 25,
"train_runtime": 191.9367,
"train_tokens_per_second": 481.825
},
{
"epoch": 0.0955033824114604,
"grad_norm": 0.3635248839855194,
"learning_rate": 4.896162295600589e-05,
"loss": 0.10165604352951049,
"num_input_tokens_seen": 112464,
"step": 30,
"train_runtime": 230.1162,
"train_tokens_per_second": 488.727
},
{
"epoch": 0.11142061281337047,
"grad_norm": 0.1722227931022644,
"learning_rate": 4.8576422584576514e-05,
"loss": 0.06480070948600769,
"num_input_tokens_seen": 130432,
"step": 35,
"train_runtime": 267.8665,
"train_tokens_per_second": 486.929
},
{
"epoch": 0.12733784321528055,
"grad_norm": 1.0766868591308594,
"learning_rate": 4.813260751184992e-05,
"loss": 0.0799346923828125,
"num_input_tokens_seen": 147776,
"step": 40,
"train_runtime": 305.7922,
"train_tokens_per_second": 483.256
},
{
"epoch": 0.14325507361719061,
"grad_norm": 0.37821757793426514,
"learning_rate": 4.763128113202537e-05,
"loss": 0.11464616060256957,
"num_input_tokens_seen": 166960,
"step": 45,
"train_runtime": 343.7831,
"train_tokens_per_second": 485.655
},
{
"epoch": 0.15917230401910068,
"grad_norm": 0.19431939721107483,
"learning_rate": 4.707368982147318e-05,
"loss": 0.036882424354553224,
"num_input_tokens_seen": 184656,
"step": 50,
"train_runtime": 381.8072,
"train_tokens_per_second": 483.637
},
{
"epoch": 0.17508953442101075,
"grad_norm": 0.21434476971626282,
"learning_rate": 4.6461219840046654e-05,
"loss": 0.05201725363731384,
"num_input_tokens_seen": 201600,
"step": 55,
"train_runtime": 419.5866,
"train_tokens_per_second": 480.473
},
{
"epoch": 0.1910067648229208,
"grad_norm": 0.18612508475780487,
"learning_rate": 4.579539388462173e-05,
"loss": 0.02669697403907776,
"num_input_tokens_seen": 219424,
"step": 60,
"train_runtime": 457.3463,
"train_tokens_per_second": 479.776
},
{
"epoch": 0.20692399522483088,
"grad_norm": 0.24218444526195526,
"learning_rate": 4.5077867303432546e-05,
"loss": 0.04229282438755035,
"num_input_tokens_seen": 237328,
"step": 65,
"train_runtime": 495.2157,
"train_tokens_per_second": 479.242
},
{
"epoch": 0.22284122562674094,
"grad_norm": 0.17901809513568878,
"learning_rate": 4.431042398061499e-05,
"loss": 0.07041661143302917,
"num_input_tokens_seen": 256384,
"step": 70,
"train_runtime": 533.4026,
"train_tokens_per_second": 480.658
},
{
"epoch": 0.238758456028651,
"grad_norm": 0.14054907858371735,
"learning_rate": 4.34949719011896e-05,
"loss": 0.07058953046798706,
"num_input_tokens_seen": 275760,
"step": 75,
"train_runtime": 571.426,
"train_tokens_per_second": 482.582
},
{
"epoch": 0.2546756864305611,
"grad_norm": 0.3583498001098633,
"learning_rate": 4.263353840751022e-05,
"loss": 0.04999509751796723,
"num_input_tokens_seen": 294912,
"step": 80,
"train_runtime": 609.9469,
"train_tokens_per_second": 483.504
},
{
"epoch": 0.27059291683247116,
"grad_norm": 0.1266777068376541,
"learning_rate": 4.172826515897146e-05,
"loss": 0.023084172606468202,
"num_input_tokens_seen": 312864,
"step": 85,
"train_runtime": 647.7469,
"train_tokens_per_second": 483.004
},
{
"epoch": 0.28651014723438123,
"grad_norm": 0.19594649970531464,
"learning_rate": 4.078140280750597e-05,
"loss": 0.027250510454177857,
"num_input_tokens_seen": 331824,
"step": 90,
"train_runtime": 685.5215,
"train_tokens_per_second": 484.046
},
{
"epoch": 0.3024273776362913,
"grad_norm": 0.13930079340934753,
"learning_rate": 3.9795305402109195e-05,
"loss": 0.021656049787998198,
"num_input_tokens_seen": 349248,
"step": 95,
"train_runtime": 723.3163,
"train_tokens_per_second": 482.843
},
{
"epoch": 0.31834460803820136,
"grad_norm": 0.09126997739076614,
"learning_rate": 3.8772424536302564e-05,
"loss": 0.01830628514289856,
"num_input_tokens_seen": 368960,
"step": 100,
"train_runtime": 761.4003,
"train_tokens_per_second": 484.581
},
{
"epoch": 0.3342618384401114,
"grad_norm": 0.182926744222641,
"learning_rate": 3.771530325308579e-05,
"loss": 0.02595718502998352,
"num_input_tokens_seen": 387312,
"step": 105,
"train_runtime": 799.8123,
"train_tokens_per_second": 484.254
},
{
"epoch": 0.3501790688420215,
"grad_norm": 0.36613690853118896,
"learning_rate": 3.662656972253127e-05,
"loss": 0.03506172299385071,
"num_input_tokens_seen": 405344,
"step": 110,
"train_runtime": 837.7863,
"train_tokens_per_second": 483.827
},
{
"epoch": 0.36609629924393156,
"grad_norm": 0.09526461362838745,
"learning_rate": 3.550893070773914e-05,
"loss": 0.02651476263999939,
"num_input_tokens_seen": 423760,
"step": 115,
"train_runtime": 876.0853,
"train_tokens_per_second": 483.697
},
{
"epoch": 0.3820135296458416,
"grad_norm": 0.11225307732820511,
"learning_rate": 3.436516483539781e-05,
"loss": 0.019444951415061952,
"num_input_tokens_seen": 442656,
"step": 120,
"train_runtime": 914.1546,
"train_tokens_per_second": 484.224
},
{
"epoch": 0.3979307600477517,
"grad_norm": 0.2590346932411194,
"learning_rate": 3.3198115687680115e-05,
"loss": 0.03442502021789551,
"num_input_tokens_seen": 460592,
"step": 125,
"train_runtime": 952.2049,
"train_tokens_per_second": 483.711
},
{
"epoch": 0.41384799044966175,
"grad_norm": 0.2646162211894989,
"learning_rate": 3.201068473265007e-05,
"loss": 0.01847824454307556,
"num_input_tokens_seen": 478992,
"step": 130,
"train_runtime": 990.3961,
"train_tokens_per_second": 483.637
},
{
"epoch": 0.4297652208515718,
"grad_norm": 0.07014801353216171,
"learning_rate": 3.0805824110756064e-05,
"loss": 0.019786083698272706,
"num_input_tokens_seen": 498912,
"step": 135,
"train_runtime": 1028.6211,
"train_tokens_per_second": 485.03
},
{
"epoch": 0.4456824512534819,
"grad_norm": 0.07959283143281937,
"learning_rate": 2.958652929534456e-05,
"loss": 0.018977819383144377,
"num_input_tokens_seen": 519280,
"step": 140,
"train_runtime": 1067.2867,
"train_tokens_per_second": 486.542
},
{
"epoch": 0.46159968165539195,
"grad_norm": 0.06549182534217834,
"learning_rate": 2.8355831645441388e-05,
"loss": 0.013403435051441193,
"num_input_tokens_seen": 537680,
"step": 145,
"train_runtime": 1105.3776,
"train_tokens_per_second": 486.422
},
{
"epoch": 0.477516912057302,
"grad_norm": 0.1639358103275299,
"learning_rate": 2.7116790869315582e-05,
"loss": 0.016910630464553832,
"num_input_tokens_seen": 556736,
"step": 150,
"train_runtime": 1143.7746,
"train_tokens_per_second": 486.753
},
{
"epoch": 0.4934341424592121,
"grad_norm": 0.08243564516305923,
"learning_rate": 2.587248741756253e-05,
"loss": 0.026160690188407897,
"num_input_tokens_seen": 574848,
"step": 155,
"train_runtime": 1181.63,
"train_tokens_per_second": 486.487
},
{
"epoch": 0.5093513728611222,
"grad_norm": 0.03133539482951164,
"learning_rate": 2.4626014824618415e-05,
"loss": 0.014300110936164855,
"num_input_tokens_seen": 595184,
"step": 160,
"train_runtime": 1220.1612,
"train_tokens_per_second": 487.791
},
{
"epoch": 0.5252686032630323,
"grad_norm": 0.18265235424041748,
"learning_rate": 2.3380472017746202e-05,
"loss": 0.01761966049671173,
"num_input_tokens_seen": 614240,
"step": 165,
"train_runtime": 1258.4126,
"train_tokens_per_second": 488.107
},
{
"epoch": 0.5411858336649423,
"grad_norm": 0.3756831884384155,
"learning_rate": 2.2138955612614207e-05,
"loss": 0.02411275953054428,
"num_input_tokens_seen": 634816,
"step": 170,
"train_runtime": 1297.0269,
"train_tokens_per_second": 489.439
},
{
"epoch": 0.5571030640668524,
"grad_norm": 0.07078292965888977,
"learning_rate": 2.090455221462156e-05,
"loss": 0.02472930997610092,
"num_input_tokens_seen": 653200,
"step": 175,
"train_runtime": 1334.905,
"train_tokens_per_second": 489.323
},
{
"epoch": 0.5730202944687625,
"grad_norm": 0.08629941940307617,
"learning_rate": 1.9680330745110954e-05,
"loss": 0.0432051956653595,
"num_input_tokens_seen": 671184,
"step": 180,
"train_runtime": 1372.8961,
"train_tokens_per_second": 488.882
},
{
"epoch": 0.5889375248706725,
"grad_norm": 0.07341516762971878,
"learning_rate": 1.8469334811546542e-05,
"loss": 0.015968725085258484,
"num_input_tokens_seen": 689328,
"step": 185,
"train_runtime": 1411.3785,
"train_tokens_per_second": 488.408
},
{
"epoch": 0.6048547552725826,
"grad_norm": 0.042029932141304016,
"learning_rate": 1.7274575140626318e-05,
"loss": 0.020535998046398163,
"num_input_tokens_seen": 707312,
"step": 190,
"train_runtime": 1449.4543,
"train_tokens_per_second": 487.985
},
{
"epoch": 0.6207719856744927,
"grad_norm": 0.09814783930778503,
"learning_rate": 1.609902209314108e-05,
"loss": 0.017926733195781707,
"num_input_tokens_seen": 726832,
"step": 195,
"train_runtime": 1487.8712,
"train_tokens_per_second": 488.505
},
{
"epoch": 0.6366892160764027,
"grad_norm": 0.06525809317827225,
"learning_rate": 1.4945598279189565e-05,
"loss": 0.020335957407951355,
"num_input_tokens_seen": 745184,
"step": 200,
"train_runtime": 1526.3493,
"train_tokens_per_second": 488.213
},
{
"epoch": 0.6526064464783128,
"grad_norm": 0.11451390385627747,
"learning_rate": 1.3817171292109183e-05,
"loss": 0.012867054343223572,
"num_input_tokens_seen": 764064,
"step": 205,
"train_runtime": 1565.3137,
"train_tokens_per_second": 488.122
},
{
"epoch": 0.6685236768802229,
"grad_norm": 0.06963406503200531,
"learning_rate": 1.271654657918722e-05,
"loss": 0.012676186859607697,
"num_input_tokens_seen": 783216,
"step": 210,
"train_runtime": 1603.6122,
"train_tokens_per_second": 488.407
},
{
"epoch": 0.6844409072821329,
"grad_norm": 0.03970273584127426,
"learning_rate": 1.1646460466876783e-05,
"loss": 0.013275411725044251,
"num_input_tokens_seen": 803760,
"step": 215,
"train_runtime": 1643.1241,
"train_tokens_per_second": 489.166
},
{
"epoch": 0.700358137684043,
"grad_norm": 0.0629667267203331,
"learning_rate": 1.0609573357858166e-05,
"loss": 0.015906769037246703,
"num_input_tokens_seen": 822352,
"step": 220,
"train_runtime": 1681.4489,
"train_tokens_per_second": 489.073
},
{
"epoch": 0.716275368085953,
"grad_norm": 0.46428775787353516,
"learning_rate": 9.608463116858542e-06,
"loss": 0.06054983139038086,
"num_input_tokens_seen": 839776,
"step": 225,
"train_runtime": 1719.5754,
"train_tokens_per_second": 488.362
},
{
"epoch": 0.7321925984878631,
"grad_norm": 0.04607592523097992,
"learning_rate": 8.645618661674142e-06,
"loss": 0.0126905158162117,
"num_input_tokens_seen": 857904,
"step": 230,
"train_runtime": 1758.1484,
"train_tokens_per_second": 487.959
},
{
"epoch": 0.7481098288897732,
"grad_norm": 0.05666354298591614,
"learning_rate": 7.723433775328384e-06,
"loss": 0.018532435595989227,
"num_input_tokens_seen": 875536,
"step": 235,
"train_runtime": 1796.0767,
"train_tokens_per_second": 487.471
},
{
"epoch": 0.7640270592916832,
"grad_norm": 0.2170793116092682,
"learning_rate": 6.844201154750177e-06,
"loss": 0.017641636729240417,
"num_input_tokens_seen": 893952,
"step": 240,
"train_runtime": 1834.3144,
"train_tokens_per_second": 487.349
},
{
"epoch": 0.7799442896935933,
"grad_norm": 0.0820794478058815,
"learning_rate": 6.010106710768052e-06,
"loss": 0.014852634072303772,
"num_input_tokens_seen": 911888,
"step": 245,
"train_runtime": 1872.6499,
"train_tokens_per_second": 486.951
},
{
"epoch": 0.7958615200955034,
"grad_norm": 0.07925046235322952,
"learning_rate": 5.223224133591476e-06,
"loss": 0.013549965620040894,
"num_input_tokens_seen": 931552,
"step": 250,
"train_runtime": 1911.0896,
"train_tokens_per_second": 487.445
},
{
"epoch": 0.8117787504974134,
"grad_norm": 0.04383081570267677,
"learning_rate": 4.4855097372902135e-06,
"loss": 0.016868625581264497,
"num_input_tokens_seen": 951232,
"step": 255,
"train_runtime": 1949.3262,
"train_tokens_per_second": 487.98
},
{
"epoch": 0.8276959808993235,
"grad_norm": 0.04657934233546257,
"learning_rate": 3.798797596089351e-06,
"loss": 0.02409391403198242,
"num_input_tokens_seen": 971248,
"step": 260,
"train_runtime": 1988.2601,
"train_tokens_per_second": 488.491
},
{
"epoch": 0.8436132113012336,
"grad_norm": 0.04718421772122383,
"learning_rate": 3.164794984571759e-06,
"loss": 0.014366105198860168,
"num_input_tokens_seen": 989568,
"step": 265,
"train_runtime": 2026.3445,
"train_tokens_per_second": 488.351
},
{
"epoch": 0.8595304417031436,
"grad_norm": 0.056470856070518494,
"learning_rate": 2.58507813312448e-06,
"loss": 0.019769111275672914,
"num_input_tokens_seen": 1008400,
"step": 270,
"train_runtime": 2064.7275,
"train_tokens_per_second": 488.394
},
{
"epoch": 0.8754476721050537,
"grad_norm": 0.05699534714221954,
"learning_rate": 2.0610883091816525e-06,
"loss": 0.012975563108921052,
"num_input_tokens_seen": 1026832,
"step": 275,
"train_runtime": 2103.4641,
"train_tokens_per_second": 488.162
},
{
"epoch": 0.8913649025069638,
"grad_norm": 0.05100962892174721,
"learning_rate": 1.59412823400657e-06,
"loss": 0.02301923781633377,
"num_input_tokens_seen": 1045568,
"step": 280,
"train_runtime": 2141.531,
"train_tokens_per_second": 488.234
},
{
"epoch": 0.9072821329088738,
"grad_norm": 0.056496769189834595,
"learning_rate": 1.1853588439213442e-06,
"loss": 0.013730129599571228,
"num_input_tokens_seen": 1064448,
"step": 285,
"train_runtime": 2180.0384,
"train_tokens_per_second": 488.27
},
{
"epoch": 0.9231993633107839,
"grad_norm": 0.05061493441462517,
"learning_rate": 8.357964040363209e-07,
"loss": 0.01429380029439926,
"num_input_tokens_seen": 1082240,
"step": 290,
"train_runtime": 2218.224,
"train_tokens_per_second": 487.886
},
{
"epoch": 0.939116593712694,
"grad_norm": 0.06360100954771042,
"learning_rate": 5.463099816548579e-07,
"loss": 0.01451290100812912,
"num_input_tokens_seen": 1100608,
"step": 295,
"train_runtime": 2256.2766,
"train_tokens_per_second": 487.798
},
{
"epoch": 0.955033824114604,
"grad_norm": 0.09003032743930817,
"learning_rate": 3.1761928563510955e-07,
"loss": 0.015449412167072296,
"num_input_tokens_seen": 1119264,
"step": 300,
"train_runtime": 2294.4496,
"train_tokens_per_second": 487.814
},
{
"epoch": 0.9709510545165141,
"grad_norm": 0.06692849099636078,
"learning_rate": 1.5029287708036854e-07,
"loss": 0.01347261518239975,
"num_input_tokens_seen": 1137216,
"step": 305,
"train_runtime": 2333.19,
"train_tokens_per_second": 487.408
},
{
"epoch": 0.9868682849184242,
"grad_norm": 0.07066839933395386,
"learning_rate": 4.474675580662113e-08,
"loss": 0.020735736191272735,
"num_input_tokens_seen": 1155552,
"step": 310,
"train_runtime": 2371.0827,
"train_tokens_per_second": 487.352
},
{
"epoch": 1.0,
"grad_norm": 0.26579365134239197,
"learning_rate": 1.2433261014244136e-09,
"loss": 0.01795462816953659,
"num_input_tokens_seen": 1170680,
"step": 315,
"train_runtime": 2402.7005,
"train_tokens_per_second": 487.235
},
{
"epoch": 1.0,
"num_input_tokens_seen": 1170680,
"step": 315,
"total_flos": 2.751640835887104e+16,
"train_loss": 0.04861170140996812,
"train_runtime": 2403.2583,
"train_samples_per_second": 2.091,
"train_steps_per_second": 0.131
}
],
"logging_steps": 5,
"max_steps": 315,
"num_input_tokens_seen": 1170680,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.751640835887104e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}