Wav2Vec2-XLS-R-300M-ASR / trainer_state.json
thantzinphyo's picture
Upload folder using huggingface_hub
a688759 verified
Raw History Blame Contribute Delete
11.4 kB
{
"best_global_step": 2000,
"best_metric": 3.5272,
"best_model_checkpoint": "/kaggle/working/wav2vec2_burmese_finetune/checkpoint-2000",
"epoch": 6.1731066460587325,
"eval_steps": 250,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.1545595054095827,
"grad_norm": 92.86918640136719,
"learning_rate": 7.35e-05,
"loss": 118.865537109375,
"step": 50
},
{
"epoch": 0.3091190108191654,
"grad_norm": 9.65009593963623,
"learning_rate": 0.00014849999999999998,
"loss": 62.2332861328125,
"step": 100
},
{
"epoch": 0.46367851622874806,
"grad_norm": 28.608802795410156,
"learning_rate": 0.00022349999999999998,
"loss": 54.4720947265625,
"step": 150
},
{
"epoch": 0.6182380216383307,
"grad_norm": 10.24120044708252,
"learning_rate": 0.0002985,
"loss": 42.8724658203125,
"step": 200
},
{
"epoch": 0.7727975270479135,
"grad_norm": 10.653837203979492,
"learning_rate": 0.0002918333333333333,
"loss": 13.04784912109375,
"step": 250
},
{
"epoch": 0.7727975270479135,
"eval_cer": 17.3965,
"eval_chrf": 66.2564,
"eval_der": 13.9757,
"eval_ier": 3.0277,
"eval_loss": 1.1601132154464722,
"eval_rtf": 0.0162,
"eval_runtime": 122.225,
"eval_samples_per_second": 18.818,
"eval_ser": 99.7826,
"eval_steps_per_second": 2.356,
"eval_wer": 72.7113,
"step": 250
},
{
"epoch": 0.9273570324574961,
"grad_norm": 7.120546340942383,
"learning_rate": 0.00028349999999999995,
"loss": 7.430888671875,
"step": 300
},
{
"epoch": 1.080370942812983,
"grad_norm": 6.679006099700928,
"learning_rate": 0.00027516666666666667,
"loss": 5.328095703125,
"step": 350
},
{
"epoch": 1.2349304482225656,
"grad_norm": 7.337920665740967,
"learning_rate": 0.00026683333333333333,
"loss": 4.352510070800781,
"step": 400
},
{
"epoch": 1.3894899536321483,
"grad_norm": 5.316799640655518,
"learning_rate": 0.0002585,
"loss": 3.869939880371094,
"step": 450
},
{
"epoch": 1.544049459041731,
"grad_norm": 8.992654800415039,
"learning_rate": 0.00025016666666666666,
"loss": 3.276860656738281,
"step": 500
},
{
"epoch": 1.544049459041731,
"eval_cer": 7.3263,
"eval_chrf": 87.3882,
"eval_der": 6.3674,
"eval_ier": 3.1642,
"eval_loss": 0.41601788997650146,
"eval_rtf": 0.0162,
"eval_runtime": 122.2346,
"eval_samples_per_second": 18.816,
"eval_ser": 87.6957,
"eval_steps_per_second": 2.356,
"eval_wer": 39.692,
"step": 500
},
{
"epoch": 1.6986089644513136,
"grad_norm": 6.284802436828613,
"learning_rate": 0.00024183333333333332,
"loss": 3.1647769165039064,
"step": 550
},
{
"epoch": 1.8531684698608966,
"grad_norm": 5.2688069343566895,
"learning_rate": 0.00023349999999999998,
"loss": 2.8377239990234373,
"step": 600
},
{
"epoch": 2.006182380216383,
"grad_norm": 3.953843355178833,
"learning_rate": 0.00022516666666666665,
"loss": 2.445658874511719,
"step": 650
},
{
"epoch": 2.160741885625966,
"grad_norm": 5.501694679260254,
"learning_rate": 0.0002168333333333333,
"loss": 1.6901881408691406,
"step": 700
},
{
"epoch": 2.3153013910355487,
"grad_norm": 3.5385491847991943,
"learning_rate": 0.00020849999999999997,
"loss": 1.681174774169922,
"step": 750
},
{
"epoch": 2.3153013910355487,
"eval_cer": 5.6848,
"eval_chrf": 91.1196,
"eval_der": 3.658,
"eval_ier": 4.3792,
"eval_loss": 0.3104187250137329,
"eval_rtf": 0.0163,
"eval_runtime": 122.6151,
"eval_samples_per_second": 18.758,
"eval_ser": 83.4348,
"eval_steps_per_second": 2.349,
"eval_wer": 33.1038,
"step": 750
},
{
"epoch": 2.469860896445131,
"grad_norm": 4.747480869293213,
"learning_rate": 0.00020016666666666666,
"loss": 1.5858328247070312,
"step": 800
},
{
"epoch": 2.624420401854714,
"grad_norm": 3.989976644515991,
"learning_rate": 0.00019183333333333333,
"loss": 1.5371478271484376,
"step": 850
},
{
"epoch": 2.7789799072642967,
"grad_norm": 4.696699142456055,
"learning_rate": 0.0001835,
"loss": 1.5103744506835937,
"step": 900
},
{
"epoch": 2.9335394126738796,
"grad_norm": 4.434220790863037,
"learning_rate": 0.00017516666666666665,
"loss": 1.4596328735351562,
"step": 950
},
{
"epoch": 3.0865533230293662,
"grad_norm": 4.2507781982421875,
"learning_rate": 0.00016683333333333331,
"loss": 1.1205237579345704,
"step": 1000
},
{
"epoch": 3.0865533230293662,
"eval_cer": 4.6817,
"eval_chrf": 92.749,
"eval_der": 5.4967,
"eval_ier": 2.43,
"eval_loss": 0.29257118701934814,
"eval_rtf": 0.0162,
"eval_runtime": 122.4439,
"eval_samples_per_second": 18.784,
"eval_ser": 78.3478,
"eval_steps_per_second": 2.352,
"eval_wer": 29.8161,
"step": 1000
},
{
"epoch": 3.2411128284389488,
"grad_norm": 3.7411551475524902,
"learning_rate": 0.00015849999999999998,
"loss": 0.8099259185791016,
"step": 1050
},
{
"epoch": 3.3956723338485317,
"grad_norm": 2.334167957305908,
"learning_rate": 0.00015016666666666664,
"loss": 0.8065882110595703,
"step": 1100
},
{
"epoch": 3.5502318392581143,
"grad_norm": 2.927462339401245,
"learning_rate": 0.00014183333333333333,
"loss": 0.782623291015625,
"step": 1150
},
{
"epoch": 3.704791344667697,
"grad_norm": 3.436811923980713,
"learning_rate": 0.0001335,
"loss": 0.7243573760986328,
"step": 1200
},
{
"epoch": 3.8593508500772797,
"grad_norm": 2.35933518409729,
"learning_rate": 0.00012516666666666666,
"loss": 0.7550306701660157,
"step": 1250
},
{
"epoch": 3.8593508500772797,
"eval_cer": 4.0849,
"eval_chrf": 93.5805,
"eval_der": 5.1524,
"eval_ier": 2.7029,
"eval_loss": 0.25579047203063965,
"eval_rtf": 0.0163,
"eval_runtime": 122.9242,
"eval_samples_per_second": 18.711,
"eval_ser": 75.087,
"eval_steps_per_second": 2.343,
"eval_wer": 27.9644,
"step": 1250
},
{
"epoch": 4.012364760432766,
"grad_norm": 1.425207257270813,
"learning_rate": 0.00011683333333333332,
"loss": 0.6849590301513672,
"step": 1300
},
{
"epoch": 4.166924265842349,
"grad_norm": 1.8370658159255981,
"learning_rate": 0.0001085,
"loss": 0.36940467834472657,
"step": 1350
},
{
"epoch": 4.321483771251932,
"grad_norm": 2.045201063156128,
"learning_rate": 0.00010016666666666666,
"loss": 0.35099597930908205,
"step": 1400
},
{
"epoch": 4.476043276661515,
"grad_norm": 1.856703519821167,
"learning_rate": 9.183333333333332e-05,
"loss": 0.3500923919677734,
"step": 1450
},
{
"epoch": 4.630602782071097,
"grad_norm": 1.648435354232788,
"learning_rate": 8.349999999999998e-05,
"loss": 0.3549906539916992,
"step": 1500
},
{
"epoch": 4.630602782071097,
"eval_cer": 3.8146,
"eval_chrf": 94.4295,
"eval_der": 4.1648,
"eval_ier": 3.2097,
"eval_loss": 0.26874977350234985,
"eval_rtf": 0.0162,
"eval_runtime": 122.2364,
"eval_samples_per_second": 18.816,
"eval_ser": 71.1739,
"eval_steps_per_second": 2.356,
"eval_wer": 25.9567,
"step": 1500
},
{
"epoch": 4.78516228748068,
"grad_norm": 3.4171347618103027,
"learning_rate": 7.516666666666665e-05,
"loss": 0.28729923248291017,
"step": 1550
},
{
"epoch": 4.939721792890262,
"grad_norm": 2.3704025745391846,
"learning_rate": 6.683333333333332e-05,
"loss": 0.3012936401367188,
"step": 1600
},
{
"epoch": 5.09273570324575,
"grad_norm": 1.861156702041626,
"learning_rate": 5.85e-05,
"loss": 0.18099090576171875,
"step": 1650
},
{
"epoch": 5.247295208655332,
"grad_norm": 1.0297614336013794,
"learning_rate": 5.016666666666666e-05,
"loss": 0.13624835014343262,
"step": 1700
},
{
"epoch": 5.401854714064915,
"grad_norm": 1.4128708839416504,
"learning_rate": 4.183333333333333e-05,
"loss": 0.1300033760070801,
"step": 1750
},
{
"epoch": 5.401854714064915,
"eval_cer": 3.6705,
"eval_chrf": 94.7013,
"eval_der": 4.769,
"eval_ier": 2.469,
"eval_loss": 0.3086535632610321,
"eval_rtf": 0.0162,
"eval_runtime": 122.3817,
"eval_samples_per_second": 18.794,
"eval_ser": 70.5652,
"eval_steps_per_second": 2.353,
"eval_wer": 25.1771,
"step": 1750
},
{
"epoch": 5.556414219474497,
"grad_norm": 2.025146722793579,
"learning_rate": 3.3499999999999994e-05,
"loss": 0.12103200912475585,
"step": 1800
},
{
"epoch": 5.710973724884081,
"grad_norm": 0.8742108345031738,
"learning_rate": 2.5166666666666664e-05,
"loss": 0.11787359237670898,
"step": 1850
},
{
"epoch": 5.865533230293663,
"grad_norm": 2.2977211475372314,
"learning_rate": 1.6833333333333334e-05,
"loss": 0.09639269828796387,
"step": 1900
},
{
"epoch": 6.01854714064915,
"grad_norm": 0.25684982538223267,
"learning_rate": 8.499999999999998e-06,
"loss": 0.07890906810760498,
"step": 1950
},
{
"epoch": 6.1731066460587325,
"grad_norm": 0.2847387194633484,
"learning_rate": 1.6666666666666665e-07,
"loss": 0.0464588737487793,
"step": 2000
},
{
"epoch": 6.1731066460587325,
"eval_cer": 3.5272,
"eval_chrf": 94.9691,
"eval_der": 3.7749,
"eval_ier": 3.0732,
"eval_loss": 0.31253764033317566,
"eval_rtf": 0.0162,
"eval_runtime": 122.3375,
"eval_samples_per_second": 18.8,
"eval_ser": 69.1304,
"eval_steps_per_second": 2.354,
"eval_wer": 24.2479,
"step": 2000
}
],
"logging_steps": 50,
"max_steps": 2000,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.866320999656968e+19,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}