{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 315, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01591723040191007, "grad_norm": 0.5680273771286011, "learning_rate": 4.998010925565448e-05, "loss": 0.722562837600708, "num_input_tokens_seen": 18800, "step": 5, "train_runtime": 39.8867, "train_tokens_per_second": 471.335 }, { "epoch": 0.03183446080382014, "grad_norm": 0.5171770453453064, "learning_rate": 4.989935734988098e-05, "loss": 0.2945201873779297, "num_input_tokens_seen": 37088, "step": 10, "train_runtime": 77.9226, "train_tokens_per_second": 475.959 }, { "epoch": 0.0477516912057302, "grad_norm": 0.26242855191230774, "learning_rate": 4.975670171853926e-05, "loss": 0.17604056596755982, "num_input_tokens_seen": 55072, "step": 15, "train_runtime": 115.5379, "train_tokens_per_second": 476.657 }, { "epoch": 0.06366892160764027, "grad_norm": 0.31670883297920227, "learning_rate": 4.9552497026005974e-05, "loss": 0.11049227714538574, "num_input_tokens_seen": 73632, "step": 20, "train_runtime": 153.8933, "train_tokens_per_second": 478.461 }, { "epoch": 0.07958615200955034, "grad_norm": 0.34576132893562317, "learning_rate": 4.928725095732169e-05, "loss": 0.09105676412582397, "num_input_tokens_seen": 92480, "step": 25, "train_runtime": 191.9367, "train_tokens_per_second": 481.825 }, { "epoch": 0.0955033824114604, "grad_norm": 0.3635248839855194, "learning_rate": 4.896162295600589e-05, "loss": 0.10165604352951049, "num_input_tokens_seen": 112464, "step": 30, "train_runtime": 230.1162, "train_tokens_per_second": 488.727 }, { "epoch": 0.11142061281337047, "grad_norm": 0.1722227931022644, "learning_rate": 4.8576422584576514e-05, "loss": 0.06480070948600769, "num_input_tokens_seen": 130432, "step": 35, "train_runtime": 267.8665, "train_tokens_per_second": 486.929 }, { "epoch": 0.12733784321528055, "grad_norm": 1.0766868591308594, "learning_rate": 4.813260751184992e-05, "loss": 0.0799346923828125, "num_input_tokens_seen": 147776, "step": 40, "train_runtime": 305.7922, "train_tokens_per_second": 483.256 }, { "epoch": 0.14325507361719061, "grad_norm": 0.37821757793426514, "learning_rate": 4.763128113202537e-05, "loss": 0.11464616060256957, "num_input_tokens_seen": 166960, "step": 45, "train_runtime": 343.7831, "train_tokens_per_second": 485.655 }, { "epoch": 0.15917230401910068, "grad_norm": 0.19431939721107483, "learning_rate": 4.707368982147318e-05, "loss": 0.036882424354553224, "num_input_tokens_seen": 184656, "step": 50, "train_runtime": 381.8072, "train_tokens_per_second": 483.637 }, { "epoch": 0.17508953442101075, "grad_norm": 0.21434476971626282, "learning_rate": 4.6461219840046654e-05, "loss": 0.05201725363731384, "num_input_tokens_seen": 201600, "step": 55, "train_runtime": 419.5866, "train_tokens_per_second": 480.473 }, { "epoch": 0.1910067648229208, "grad_norm": 0.18612508475780487, "learning_rate": 4.579539388462173e-05, "loss": 0.02669697403907776, "num_input_tokens_seen": 219424, "step": 60, "train_runtime": 457.3463, "train_tokens_per_second": 479.776 }, { "epoch": 0.20692399522483088, "grad_norm": 0.24218444526195526, "learning_rate": 4.5077867303432546e-05, "loss": 0.04229282438755035, "num_input_tokens_seen": 237328, "step": 65, "train_runtime": 495.2157, "train_tokens_per_second": 479.242 }, { "epoch": 0.22284122562674094, "grad_norm": 0.17901809513568878, "learning_rate": 4.431042398061499e-05, "loss": 0.07041661143302917, "num_input_tokens_seen": 256384, "step": 70, "train_runtime": 533.4026, "train_tokens_per_second": 480.658 }, { "epoch": 0.238758456028651, "grad_norm": 0.14054907858371735, "learning_rate": 4.34949719011896e-05, "loss": 0.07058953046798706, "num_input_tokens_seen": 275760, "step": 75, "train_runtime": 571.426, "train_tokens_per_second": 482.582 }, { "epoch": 0.2546756864305611, "grad_norm": 0.3583498001098633, "learning_rate": 4.263353840751022e-05, "loss": 0.04999509751796723, "num_input_tokens_seen": 294912, "step": 80, "train_runtime": 609.9469, "train_tokens_per_second": 483.504 }, { "epoch": 0.27059291683247116, "grad_norm": 0.1266777068376541, "learning_rate": 4.172826515897146e-05, "loss": 0.023084172606468202, "num_input_tokens_seen": 312864, "step": 85, "train_runtime": 647.7469, "train_tokens_per_second": 483.004 }, { "epoch": 0.28651014723438123, "grad_norm": 0.19594649970531464, "learning_rate": 4.078140280750597e-05, "loss": 0.027250510454177857, "num_input_tokens_seen": 331824, "step": 90, "train_runtime": 685.5215, "train_tokens_per_second": 484.046 }, { "epoch": 0.3024273776362913, "grad_norm": 0.13930079340934753, "learning_rate": 3.9795305402109195e-05, "loss": 0.021656049787998198, "num_input_tokens_seen": 349248, "step": 95, "train_runtime": 723.3163, "train_tokens_per_second": 482.843 }, { "epoch": 0.31834460803820136, "grad_norm": 0.09126997739076614, "learning_rate": 3.8772424536302564e-05, "loss": 0.01830628514289856, "num_input_tokens_seen": 368960, "step": 100, "train_runtime": 761.4003, "train_tokens_per_second": 484.581 }, { "epoch": 0.3342618384401114, "grad_norm": 0.182926744222641, "learning_rate": 3.771530325308579e-05, "loss": 0.02595718502998352, "num_input_tokens_seen": 387312, "step": 105, "train_runtime": 799.8123, "train_tokens_per_second": 484.254 }, { "epoch": 0.3501790688420215, "grad_norm": 0.36613690853118896, "learning_rate": 3.662656972253127e-05, "loss": 0.03506172299385071, "num_input_tokens_seen": 405344, "step": 110, "train_runtime": 837.7863, "train_tokens_per_second": 483.827 }, { "epoch": 0.36609629924393156, "grad_norm": 0.09526461362838745, "learning_rate": 3.550893070773914e-05, "loss": 0.02651476263999939, "num_input_tokens_seen": 423760, "step": 115, "train_runtime": 876.0853, "train_tokens_per_second": 483.697 }, { "epoch": 0.3820135296458416, "grad_norm": 0.11225307732820511, "learning_rate": 3.436516483539781e-05, "loss": 0.019444951415061952, "num_input_tokens_seen": 442656, "step": 120, "train_runtime": 914.1546, "train_tokens_per_second": 484.224 }, { "epoch": 0.3979307600477517, "grad_norm": 0.2590346932411194, "learning_rate": 3.3198115687680115e-05, "loss": 0.03442502021789551, "num_input_tokens_seen": 460592, "step": 125, "train_runtime": 952.2049, "train_tokens_per_second": 483.711 }, { "epoch": 0.41384799044966175, "grad_norm": 0.2646162211894989, "learning_rate": 3.201068473265007e-05, "loss": 0.01847824454307556, "num_input_tokens_seen": 478992, "step": 130, "train_runtime": 990.3961, "train_tokens_per_second": 483.637 }, { "epoch": 0.4297652208515718, "grad_norm": 0.07014801353216171, "learning_rate": 3.0805824110756064e-05, "loss": 0.019786083698272706, "num_input_tokens_seen": 498912, "step": 135, "train_runtime": 1028.6211, "train_tokens_per_second": 485.03 }, { "epoch": 0.4456824512534819, "grad_norm": 0.07959283143281937, "learning_rate": 2.958652929534456e-05, "loss": 0.018977819383144377, "num_input_tokens_seen": 519280, "step": 140, "train_runtime": 1067.2867, "train_tokens_per_second": 486.542 }, { "epoch": 0.46159968165539195, "grad_norm": 0.06549182534217834, "learning_rate": 2.8355831645441388e-05, "loss": 0.013403435051441193, "num_input_tokens_seen": 537680, "step": 145, "train_runtime": 1105.3776, "train_tokens_per_second": 486.422 }, { "epoch": 0.477516912057302, "grad_norm": 0.1639358103275299, "learning_rate": 2.7116790869315582e-05, "loss": 0.016910630464553832, "num_input_tokens_seen": 556736, "step": 150, "train_runtime": 1143.7746, "train_tokens_per_second": 486.753 }, { "epoch": 0.4934341424592121, "grad_norm": 0.08243564516305923, "learning_rate": 2.587248741756253e-05, "loss": 0.026160690188407897, "num_input_tokens_seen": 574848, "step": 155, "train_runtime": 1181.63, "train_tokens_per_second": 486.487 }, { "epoch": 0.5093513728611222, "grad_norm": 0.03133539482951164, "learning_rate": 2.4626014824618415e-05, "loss": 0.014300110936164855, "num_input_tokens_seen": 595184, "step": 160, "train_runtime": 1220.1612, "train_tokens_per_second": 487.791 }, { "epoch": 0.5252686032630323, "grad_norm": 0.18265235424041748, "learning_rate": 2.3380472017746202e-05, "loss": 0.01761966049671173, "num_input_tokens_seen": 614240, "step": 165, "train_runtime": 1258.4126, "train_tokens_per_second": 488.107 }, { "epoch": 0.5411858336649423, "grad_norm": 0.3756831884384155, "learning_rate": 2.2138955612614207e-05, "loss": 0.02411275953054428, "num_input_tokens_seen": 634816, "step": 170, "train_runtime": 1297.0269, "train_tokens_per_second": 489.439 }, { "epoch": 0.5571030640668524, "grad_norm": 0.07078292965888977, "learning_rate": 2.090455221462156e-05, "loss": 0.02472930997610092, "num_input_tokens_seen": 653200, "step": 175, "train_runtime": 1334.905, "train_tokens_per_second": 489.323 }, { "epoch": 0.5730202944687625, "grad_norm": 0.08629941940307617, "learning_rate": 1.9680330745110954e-05, "loss": 0.0432051956653595, "num_input_tokens_seen": 671184, "step": 180, "train_runtime": 1372.8961, "train_tokens_per_second": 488.882 }, { "epoch": 0.5889375248706725, "grad_norm": 0.07341516762971878, "learning_rate": 1.8469334811546542e-05, "loss": 0.015968725085258484, "num_input_tokens_seen": 689328, "step": 185, "train_runtime": 1411.3785, "train_tokens_per_second": 488.408 }, { "epoch": 0.6048547552725826, "grad_norm": 0.042029932141304016, "learning_rate": 1.7274575140626318e-05, "loss": 0.020535998046398163, "num_input_tokens_seen": 707312, "step": 190, "train_runtime": 1449.4543, "train_tokens_per_second": 487.985 }, { "epoch": 0.6207719856744927, "grad_norm": 0.09814783930778503, "learning_rate": 1.609902209314108e-05, "loss": 0.017926733195781707, "num_input_tokens_seen": 726832, "step": 195, "train_runtime": 1487.8712, "train_tokens_per_second": 488.505 }, { "epoch": 0.6366892160764027, "grad_norm": 0.06525809317827225, "learning_rate": 1.4945598279189565e-05, "loss": 0.020335957407951355, "num_input_tokens_seen": 745184, "step": 200, "train_runtime": 1526.3493, "train_tokens_per_second": 488.213 }, { "epoch": 0.6526064464783128, "grad_norm": 0.11451390385627747, "learning_rate": 1.3817171292109183e-05, "loss": 0.012867054343223572, "num_input_tokens_seen": 764064, "step": 205, "train_runtime": 1565.3137, "train_tokens_per_second": 488.122 }, { "epoch": 0.6685236768802229, "grad_norm": 0.06963406503200531, "learning_rate": 1.271654657918722e-05, "loss": 0.012676186859607697, "num_input_tokens_seen": 783216, "step": 210, "train_runtime": 1603.6122, "train_tokens_per_second": 488.407 }, { "epoch": 0.6844409072821329, "grad_norm": 0.03970273584127426, "learning_rate": 1.1646460466876783e-05, "loss": 0.013275411725044251, "num_input_tokens_seen": 803760, "step": 215, "train_runtime": 1643.1241, "train_tokens_per_second": 489.166 }, { "epoch": 0.700358137684043, "grad_norm": 0.0629667267203331, "learning_rate": 1.0609573357858166e-05, "loss": 0.015906769037246703, "num_input_tokens_seen": 822352, "step": 220, "train_runtime": 1681.4489, "train_tokens_per_second": 489.073 }, { "epoch": 0.716275368085953, "grad_norm": 0.46428775787353516, "learning_rate": 9.608463116858542e-06, "loss": 0.06054983139038086, "num_input_tokens_seen": 839776, "step": 225, "train_runtime": 1719.5754, "train_tokens_per_second": 488.362 }, { "epoch": 0.7321925984878631, "grad_norm": 0.04607592523097992, "learning_rate": 8.645618661674142e-06, "loss": 0.0126905158162117, "num_input_tokens_seen": 857904, "step": 230, "train_runtime": 1758.1484, "train_tokens_per_second": 487.959 }, { "epoch": 0.7481098288897732, "grad_norm": 0.05666354298591614, "learning_rate": 7.723433775328384e-06, "loss": 0.018532435595989227, "num_input_tokens_seen": 875536, "step": 235, "train_runtime": 1796.0767, "train_tokens_per_second": 487.471 }, { "epoch": 0.7640270592916832, "grad_norm": 0.2170793116092682, "learning_rate": 6.844201154750177e-06, "loss": 0.017641636729240417, "num_input_tokens_seen": 893952, "step": 240, "train_runtime": 1834.3144, "train_tokens_per_second": 487.349 }, { "epoch": 0.7799442896935933, "grad_norm": 0.0820794478058815, "learning_rate": 6.010106710768052e-06, "loss": 0.014852634072303772, "num_input_tokens_seen": 911888, "step": 245, "train_runtime": 1872.6499, "train_tokens_per_second": 486.951 }, { "epoch": 0.7958615200955034, "grad_norm": 0.07925046235322952, "learning_rate": 5.223224133591476e-06, "loss": 0.013549965620040894, "num_input_tokens_seen": 931552, "step": 250, "train_runtime": 1911.0896, "train_tokens_per_second": 487.445 }, { "epoch": 0.8117787504974134, "grad_norm": 0.04383081570267677, "learning_rate": 4.4855097372902135e-06, "loss": 0.016868625581264497, "num_input_tokens_seen": 951232, "step": 255, "train_runtime": 1949.3262, "train_tokens_per_second": 487.98 }, { "epoch": 0.8276959808993235, "grad_norm": 0.04657934233546257, "learning_rate": 3.798797596089351e-06, "loss": 0.02409391403198242, "num_input_tokens_seen": 971248, "step": 260, "train_runtime": 1988.2601, "train_tokens_per_second": 488.491 }, { "epoch": 0.8436132113012336, "grad_norm": 0.04718421772122383, "learning_rate": 3.164794984571759e-06, "loss": 0.014366105198860168, "num_input_tokens_seen": 989568, "step": 265, "train_runtime": 2026.3445, "train_tokens_per_second": 488.351 }, { "epoch": 0.8595304417031436, "grad_norm": 0.056470856070518494, "learning_rate": 2.58507813312448e-06, "loss": 0.019769111275672914, "num_input_tokens_seen": 1008400, "step": 270, "train_runtime": 2064.7275, "train_tokens_per_second": 488.394 }, { "epoch": 0.8754476721050537, "grad_norm": 0.05699534714221954, "learning_rate": 2.0610883091816525e-06, "loss": 0.012975563108921052, "num_input_tokens_seen": 1026832, "step": 275, "train_runtime": 2103.4641, "train_tokens_per_second": 488.162 }, { "epoch": 0.8913649025069638, "grad_norm": 0.05100962892174721, "learning_rate": 1.59412823400657e-06, "loss": 0.02301923781633377, "num_input_tokens_seen": 1045568, "step": 280, "train_runtime": 2141.531, "train_tokens_per_second": 488.234 }, { "epoch": 0.9072821329088738, "grad_norm": 0.056496769189834595, "learning_rate": 1.1853588439213442e-06, "loss": 0.013730129599571228, "num_input_tokens_seen": 1064448, "step": 285, "train_runtime": 2180.0384, "train_tokens_per_second": 488.27 }, { "epoch": 0.9231993633107839, "grad_norm": 0.05061493441462517, "learning_rate": 8.357964040363209e-07, "loss": 0.01429380029439926, "num_input_tokens_seen": 1082240, "step": 290, "train_runtime": 2218.224, "train_tokens_per_second": 487.886 }, { "epoch": 0.939116593712694, "grad_norm": 0.06360100954771042, "learning_rate": 5.463099816548579e-07, "loss": 0.01451290100812912, "num_input_tokens_seen": 1100608, "step": 295, "train_runtime": 2256.2766, "train_tokens_per_second": 487.798 }, { "epoch": 0.955033824114604, "grad_norm": 0.09003032743930817, "learning_rate": 3.1761928563510955e-07, "loss": 0.015449412167072296, "num_input_tokens_seen": 1119264, "step": 300, "train_runtime": 2294.4496, "train_tokens_per_second": 487.814 }, { "epoch": 0.9709510545165141, "grad_norm": 0.06692849099636078, "learning_rate": 1.5029287708036854e-07, "loss": 0.01347261518239975, "num_input_tokens_seen": 1137216, "step": 305, "train_runtime": 2333.19, "train_tokens_per_second": 487.408 }, { "epoch": 0.9868682849184242, "grad_norm": 0.07066839933395386, "learning_rate": 4.474675580662113e-08, "loss": 0.020735736191272735, "num_input_tokens_seen": 1155552, "step": 310, "train_runtime": 2371.0827, "train_tokens_per_second": 487.352 }, { "epoch": 1.0, "grad_norm": 0.26579365134239197, "learning_rate": 1.2433261014244136e-09, "loss": 0.01795462816953659, "num_input_tokens_seen": 1170680, "step": 315, "train_runtime": 2402.7005, "train_tokens_per_second": 487.235 }, { "epoch": 1.0, "num_input_tokens_seen": 1170680, "step": 315, "total_flos": 2.751640835887104e+16, "train_loss": 0.04861170140996812, "train_runtime": 2403.2583, "train_samples_per_second": 2.091, "train_steps_per_second": 0.131 } ], "logging_steps": 5, "max_steps": 315, "num_input_tokens_seen": 1170680, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.751640835887104e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }