liquid-2.6B-QAT-LoRA-Adapter / trainer_state.json
OpenIntelligenceNet's picture
Upload 800-step QAT LoRA adapters
31157c6 verified
Raw
History Blame Contribute Delete
15.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.10958153551126636,
"eval_steps": 500,
"global_step": 800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0013697691938908295,
"grad_norm": 0.36237362027168274,
"learning_rate": 3.5e-06,
"loss": 2.435038375854492,
"step": 10
},
{
"epoch": 0.002739538387781659,
"grad_norm": 0.36249515414237976,
"learning_rate": 8.5e-06,
"loss": 2.2692413330078125,
"step": 20
},
{
"epoch": 0.004109307581672488,
"grad_norm": 0.3869870603084564,
"learning_rate": 1.3500000000000001e-05,
"loss": 2.338268280029297,
"step": 30
},
{
"epoch": 0.005479076775563318,
"grad_norm": 0.43124574422836304,
"learning_rate": 1.8500000000000002e-05,
"loss": 2.3821529388427733,
"step": 40
},
{
"epoch": 0.006848845969454147,
"grad_norm": 0.4636060893535614,
"learning_rate": 1.9815789473684213e-05,
"loss": 2.3642246246337892,
"step": 50
},
{
"epoch": 0.008218615163344977,
"grad_norm": 0.4747641980648041,
"learning_rate": 1.955263157894737e-05,
"loss": 2.3556377410888674,
"step": 60
},
{
"epoch": 0.009588384357235805,
"grad_norm": 0.6179090738296509,
"learning_rate": 1.9289473684210526e-05,
"loss": 2.3772085189819334,
"step": 70
},
{
"epoch": 0.010958153551126636,
"grad_norm": 0.6049761772155762,
"learning_rate": 1.9026315789473686e-05,
"loss": 2.2972381591796873,
"step": 80
},
{
"epoch": 0.012327922745017464,
"grad_norm": 0.6118033528327942,
"learning_rate": 1.8763157894736843e-05,
"loss": 2.352596473693848,
"step": 90
},
{
"epoch": 0.013697691938908295,
"grad_norm": 0.6712182760238647,
"learning_rate": 1.8500000000000002e-05,
"loss": 2.2117843627929688,
"step": 100
},
{
"epoch": 0.015067461132799123,
"grad_norm": 0.6315696239471436,
"learning_rate": 1.823684210526316e-05,
"loss": 2.239790344238281,
"step": 110
},
{
"epoch": 0.016437230326689953,
"grad_norm": 0.5321571230888367,
"learning_rate": 1.7973684210526315e-05,
"loss": 2.1258014678955077,
"step": 120
},
{
"epoch": 0.017806999520580784,
"grad_norm": 0.5182818174362183,
"learning_rate": 1.7710526315789475e-05,
"loss": 2.2043216705322264,
"step": 130
},
{
"epoch": 0.01917676871447161,
"grad_norm": 0.5181311964988708,
"learning_rate": 1.7447368421052632e-05,
"loss": 2.166463088989258,
"step": 140
},
{
"epoch": 0.02054653790836244,
"grad_norm": 0.48421230912208557,
"learning_rate": 1.7184210526315788e-05,
"loss": 2.1357837677001954,
"step": 150
},
{
"epoch": 0.02191630710225327,
"grad_norm": 0.4353867769241333,
"learning_rate": 1.6921052631578948e-05,
"loss": 2.0161502838134764,
"step": 160
},
{
"epoch": 0.023286076296144098,
"grad_norm": 0.4691782593727112,
"learning_rate": 1.6657894736842105e-05,
"loss": 2.0219562530517576,
"step": 170
},
{
"epoch": 0.02465584549003493,
"grad_norm": 0.49481505155563354,
"learning_rate": 1.6394736842105265e-05,
"loss": 2.0304351806640626,
"step": 180
},
{
"epoch": 0.02602561468392576,
"grad_norm": 0.3865645229816437,
"learning_rate": 1.613157894736842e-05,
"loss": 1.9581424713134765,
"step": 190
},
{
"epoch": 0.02739538387781659,
"grad_norm": 0.43848446011543274,
"learning_rate": 1.586842105263158e-05,
"loss": 1.981527328491211,
"step": 200
},
{
"epoch": 0.028765153071707416,
"grad_norm": 0.39352574944496155,
"learning_rate": 1.5605263157894737e-05,
"loss": 2.059296798706055,
"step": 210
},
{
"epoch": 0.030134922265598246,
"grad_norm": 0.46410003304481506,
"learning_rate": 1.5342105263157897e-05,
"loss": 1.913700485229492,
"step": 220
},
{
"epoch": 0.03150469145948907,
"grad_norm": 0.3708699345588684,
"learning_rate": 1.5078947368421054e-05,
"loss": 1.9376255035400392,
"step": 230
},
{
"epoch": 0.03287446065337991,
"grad_norm": 0.410113126039505,
"learning_rate": 1.4815789473684212e-05,
"loss": 1.9357620239257813,
"step": 240
},
{
"epoch": 0.034244229847270734,
"grad_norm": 0.34002822637557983,
"learning_rate": 1.455263157894737e-05,
"loss": 1.855245590209961,
"step": 250
},
{
"epoch": 0.03561399904116157,
"grad_norm": 0.38149112462997437,
"learning_rate": 1.4289473684210527e-05,
"loss": 1.8379920959472655,
"step": 260
},
{
"epoch": 0.036983768235052394,
"grad_norm": 0.3515079915523529,
"learning_rate": 1.4026315789473685e-05,
"loss": 1.9092113494873046,
"step": 270
},
{
"epoch": 0.03835353742894322,
"grad_norm": 0.34938475489616394,
"learning_rate": 1.3763157894736843e-05,
"loss": 1.83590087890625,
"step": 280
},
{
"epoch": 0.039723306622834055,
"grad_norm": 0.3297061324119568,
"learning_rate": 1.3500000000000001e-05,
"loss": 1.9256158828735352,
"step": 290
},
{
"epoch": 0.04109307581672488,
"grad_norm": 0.36877989768981934,
"learning_rate": 1.323684210526316e-05,
"loss": 1.8834123611450195,
"step": 300
},
{
"epoch": 0.04246284501061571,
"grad_norm": 0.29596567153930664,
"learning_rate": 1.2973684210526316e-05,
"loss": 1.7876396179199219,
"step": 310
},
{
"epoch": 0.04383261420450654,
"grad_norm": 0.31500086188316345,
"learning_rate": 1.2710526315789476e-05,
"loss": 1.8464454650878905,
"step": 320
},
{
"epoch": 0.04520238339839737,
"grad_norm": 0.3053838610649109,
"learning_rate": 1.2447368421052632e-05,
"loss": 1.8393360137939454,
"step": 330
},
{
"epoch": 0.046572152592288196,
"grad_norm": 0.3389897346496582,
"learning_rate": 1.2184210526315789e-05,
"loss": 1.8508255004882812,
"step": 340
},
{
"epoch": 0.04794192178617903,
"grad_norm": 0.27679404616355896,
"learning_rate": 1.1921052631578949e-05,
"loss": 1.8790317535400392,
"step": 350
},
{
"epoch": 0.04931169098006986,
"grad_norm": 0.29857176542282104,
"learning_rate": 1.1657894736842105e-05,
"loss": 1.8166206359863282,
"step": 360
},
{
"epoch": 0.05068146017396069,
"grad_norm": 0.307064950466156,
"learning_rate": 1.1394736842105265e-05,
"loss": 1.740498161315918,
"step": 370
},
{
"epoch": 0.05205122936785152,
"grad_norm": 0.2849220931529999,
"learning_rate": 1.1131578947368421e-05,
"loss": 1.86405029296875,
"step": 380
},
{
"epoch": 0.053420998561742344,
"grad_norm": 0.2507258653640747,
"learning_rate": 1.086842105263158e-05,
"loss": 1.8203811645507812,
"step": 390
},
{
"epoch": 0.05479076775563318,
"grad_norm": 0.32056924700737,
"learning_rate": 1.0605263157894738e-05,
"loss": 1.8383829116821289,
"step": 400
},
{
"epoch": 0.056160536949524005,
"grad_norm": 0.3862442374229431,
"learning_rate": 1.0342105263157896e-05,
"loss": 1.7965122222900392,
"step": 410
},
{
"epoch": 0.05753030614341483,
"grad_norm": 0.2158074676990509,
"learning_rate": 1.0078947368421053e-05,
"loss": 1.7655912399291993,
"step": 420
},
{
"epoch": 0.058900075337305666,
"grad_norm": 0.27215778827667236,
"learning_rate": 9.815789473684212e-06,
"loss": 1.7762609481811524,
"step": 430
},
{
"epoch": 0.06026984453119649,
"grad_norm": 0.2439756989479065,
"learning_rate": 9.552631578947369e-06,
"loss": 1.7678848266601563,
"step": 440
},
{
"epoch": 0.06163961372508732,
"grad_norm": 0.3162086009979248,
"learning_rate": 9.289473684210527e-06,
"loss": 1.8514827728271483,
"step": 450
},
{
"epoch": 0.06300938291897815,
"grad_norm": 0.280586838722229,
"learning_rate": 9.026315789473685e-06,
"loss": 1.8047622680664062,
"step": 460
},
{
"epoch": 0.06437915211286899,
"grad_norm": 0.22920483350753784,
"learning_rate": 8.763157894736842e-06,
"loss": 1.7634853363037108,
"step": 470
},
{
"epoch": 0.06574892130675981,
"grad_norm": 0.2582913637161255,
"learning_rate": 8.5e-06,
"loss": 1.8084178924560548,
"step": 480
},
{
"epoch": 0.06711869050065064,
"grad_norm": 0.22125154733657837,
"learning_rate": 8.236842105263158e-06,
"loss": 1.7368389129638673,
"step": 490
},
{
"epoch": 0.06848845969454147,
"grad_norm": 0.22868144512176514,
"learning_rate": 7.973684210526316e-06,
"loss": 1.7524850845336915,
"step": 500
},
{
"epoch": 0.0698582288884323,
"grad_norm": 0.42042723298072815,
"learning_rate": 7.710526315789474e-06,
"loss": 1.7123191833496094,
"step": 510
},
{
"epoch": 0.07122799808232314,
"grad_norm": 0.2862432599067688,
"learning_rate": 7.447368421052632e-06,
"loss": 1.729414939880371,
"step": 520
},
{
"epoch": 0.07259776727621396,
"grad_norm": 0.2237967550754547,
"learning_rate": 7.18421052631579e-06,
"loss": 1.7572792053222657,
"step": 530
},
{
"epoch": 0.07396753647010479,
"grad_norm": 0.2615198493003845,
"learning_rate": 6.921052631578948e-06,
"loss": 1.78935546875,
"step": 540
},
{
"epoch": 0.07533730566399562,
"grad_norm": 0.215779110789299,
"learning_rate": 6.6578947368421055e-06,
"loss": 1.753053855895996,
"step": 550
},
{
"epoch": 0.07670707485788644,
"grad_norm": 0.20498128235340118,
"learning_rate": 6.394736842105264e-06,
"loss": 1.6631881713867187,
"step": 560
},
{
"epoch": 0.07807684405177727,
"grad_norm": 0.216533824801445,
"learning_rate": 6.131578947368422e-06,
"loss": 1.7446210861206055,
"step": 570
},
{
"epoch": 0.07944661324566811,
"grad_norm": 0.25069892406463623,
"learning_rate": 5.86842105263158e-06,
"loss": 1.805841064453125,
"step": 580
},
{
"epoch": 0.08081638243955894,
"grad_norm": 0.2501865327358246,
"learning_rate": 5.605263157894737e-06,
"loss": 1.7990594863891602,
"step": 590
},
{
"epoch": 0.08218615163344976,
"grad_norm": 0.23411990702152252,
"learning_rate": 5.342105263157895e-06,
"loss": 1.72657470703125,
"step": 600
},
{
"epoch": 0.08355592082734059,
"grad_norm": 0.25468888878822327,
"learning_rate": 5.078947368421053e-06,
"loss": 1.6869335174560547,
"step": 610
},
{
"epoch": 0.08492569002123142,
"grad_norm": 0.20213402807712555,
"learning_rate": 4.815789473684211e-06,
"loss": 1.6238441467285156,
"step": 620
},
{
"epoch": 0.08629545921512226,
"grad_norm": 0.22670616209506989,
"learning_rate": 4.552631578947369e-06,
"loss": 1.7246341705322266,
"step": 630
},
{
"epoch": 0.08766522840901309,
"grad_norm": 0.27973708510398865,
"learning_rate": 4.289473684210527e-06,
"loss": 1.7155805587768556,
"step": 640
},
{
"epoch": 0.08903499760290391,
"grad_norm": 0.24762506783008575,
"learning_rate": 4.026315789473684e-06,
"loss": 1.706759262084961,
"step": 650
},
{
"epoch": 0.09040476679679474,
"grad_norm": 0.3544348478317261,
"learning_rate": 3.7631578947368426e-06,
"loss": 1.676065444946289,
"step": 660
},
{
"epoch": 0.09177453599068557,
"grad_norm": 0.213600754737854,
"learning_rate": 3.5e-06,
"loss": 1.7575370788574218,
"step": 670
},
{
"epoch": 0.09314430518457639,
"grad_norm": 0.20907212793827057,
"learning_rate": 3.236842105263158e-06,
"loss": 1.681616973876953,
"step": 680
},
{
"epoch": 0.09451407437846723,
"grad_norm": 0.2494778037071228,
"learning_rate": 2.973684210526316e-06,
"loss": 1.7092714309692383,
"step": 690
},
{
"epoch": 0.09588384357235806,
"grad_norm": 0.2179274708032608,
"learning_rate": 2.710526315789474e-06,
"loss": 1.7354896545410157,
"step": 700
},
{
"epoch": 0.09725361276624889,
"grad_norm": 0.24646683037281036,
"learning_rate": 2.447368421052632e-06,
"loss": 1.723104476928711,
"step": 710
},
{
"epoch": 0.09862338196013971,
"grad_norm": 0.21943680942058563,
"learning_rate": 2.1842105263157896e-06,
"loss": 1.8309019088745118,
"step": 720
},
{
"epoch": 0.09999315115403054,
"grad_norm": 0.2424953579902649,
"learning_rate": 1.9210526315789474e-06,
"loss": 1.703164291381836,
"step": 730
},
{
"epoch": 0.10136292034792138,
"grad_norm": 0.2525971531867981,
"learning_rate": 1.6578947368421053e-06,
"loss": 1.7882774353027344,
"step": 740
},
{
"epoch": 0.10273268954181221,
"grad_norm": 0.2217267006635666,
"learning_rate": 1.394736842105263e-06,
"loss": 1.7480182647705078,
"step": 750
},
{
"epoch": 0.10410245873570304,
"grad_norm": 0.2686385214328766,
"learning_rate": 1.1315789473684213e-06,
"loss": 1.712969970703125,
"step": 760
},
{
"epoch": 0.10547222792959386,
"grad_norm": 0.23270924389362335,
"learning_rate": 8.68421052631579e-07,
"loss": 1.727523422241211,
"step": 770
},
{
"epoch": 0.10684199712348469,
"grad_norm": 0.21745167672634125,
"learning_rate": 6.052631578947369e-07,
"loss": 1.7345813751220702,
"step": 780
},
{
"epoch": 0.10821176631737552,
"grad_norm": 0.24494187533855438,
"learning_rate": 3.421052631578948e-07,
"loss": 1.7722370147705078,
"step": 790
},
{
"epoch": 0.10958153551126636,
"grad_norm": 0.19390442967414856,
"learning_rate": 7.894736842105264e-08,
"loss": 1.760666275024414,
"step": 800
}
],
"logging_steps": 10,
"max_steps": 800,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 400,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.9111174457838797e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}