Download trainer_state.json from Ansu/whisper-tiny-basque: direct link, hf CLI and curl.
- Browser
- Download file 69.2 kB
-
https://huggingface.co/Ansu/whisper-tiny-basque/resolve/main/trainer_state.json
- Command line
-
hf download hf://Ansu/whisper-tiny-basque/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/Ansu/whisper-tiny-basque/resolve/main/trainer_state.json
69.2 kB
| { | |
| "best_metric": 22.41163981516173, | |
| "best_model_checkpoint": "/scratch/andoni.sudupe/checkpoints/sweep_new/tiny/lr1e-5/checkpoint-9000", | |
| "epoch": 6.605019815059445, | |
| "eval_steps": 500, | |
| "global_step": 10000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 34.077606201171875, | |
| "learning_rate": 4.4e-07, | |
| "loss": 4.2904, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 23.43511199951172, | |
| "learning_rate": 9.400000000000001e-07, | |
| "loss": 3.9844, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 16.568195343017578, | |
| "learning_rate": 1.44e-06, | |
| "loss": 3.4183, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 14.12092113494873, | |
| "learning_rate": 1.94e-06, | |
| "loss": 2.821, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 7.320805549621582, | |
| "learning_rate": 2.4400000000000004e-06, | |
| "loss": 2.2669, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 6.777274131774902, | |
| "learning_rate": 2.9400000000000002e-06, | |
| "loss": 1.9647, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 6.5238447189331055, | |
| "learning_rate": 3.44e-06, | |
| "loss": 1.7396, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 6.274177074432373, | |
| "learning_rate": 3.94e-06, | |
| "loss": 1.5854, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 6.0430803298950195, | |
| "learning_rate": 4.440000000000001e-06, | |
| "loss": 1.45, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 5.32307243347168, | |
| "learning_rate": 4.94e-06, | |
| "loss": 1.3254, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 3.9543581008911133, | |
| "learning_rate": 5.4400000000000004e-06, | |
| "loss": 1.2132, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 3.564781427383423, | |
| "learning_rate": 5.94e-06, | |
| "loss": 1.1088, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 3.724240303039551, | |
| "learning_rate": 6.440000000000001e-06, | |
| "loss": 0.9806, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 5.0616254806518555, | |
| "learning_rate": 6.9400000000000005e-06, | |
| "loss": 0.7913, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 5.042689800262451, | |
| "learning_rate": 7.440000000000001e-06, | |
| "loss": 0.6871, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 3.1566641330718994, | |
| "learning_rate": 7.94e-06, | |
| "loss": 0.6291, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 3.285292148590088, | |
| "learning_rate": 8.44e-06, | |
| "loss": 0.5892, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 3.3190643787384033, | |
| "learning_rate": 8.94e-06, | |
| "loss": 0.567, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 3.9897689819335938, | |
| "learning_rate": 9.440000000000001e-06, | |
| "loss": 0.5383, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 2.80560040473938, | |
| "learning_rate": 9.940000000000001e-06, | |
| "loss": 0.5114, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "eval_loss": 0.6930010914802551, | |
| "eval_runtime": 21.1291, | |
| "eval_samples_per_second": 80.032, | |
| "eval_steps_per_second": 0.663, | |
| "eval_wer": 52.52279255651305, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 2.685612678527832, | |
| "learning_rate": 9.976842105263158e-06, | |
| "loss": 0.4912, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 2.799072742462158, | |
| "learning_rate": 9.950526315789475e-06, | |
| "loss": 0.4752, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 2.7478973865509033, | |
| "learning_rate": 9.92421052631579e-06, | |
| "loss": 0.4556, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 2.917057991027832, | |
| "learning_rate": 9.897894736842107e-06, | |
| "loss": 0.4415, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 4.174392223358154, | |
| "learning_rate": 9.871578947368422e-06, | |
| "loss": 0.4228, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 2.487973213195801, | |
| "learning_rate": 9.845263157894738e-06, | |
| "loss": 0.4103, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 2.432943820953369, | |
| "learning_rate": 9.818947368421053e-06, | |
| "loss": 0.3984, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 2.607616901397705, | |
| "learning_rate": 9.79263157894737e-06, | |
| "loss": 0.3877, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 2.3920302391052246, | |
| "learning_rate": 9.766315789473685e-06, | |
| "loss": 0.3788, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 2.441880702972412, | |
| "learning_rate": 9.74e-06, | |
| "loss": 0.3758, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 2.3188793659210205, | |
| "learning_rate": 9.713684210526317e-06, | |
| "loss": 0.3662, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 2.532235622406006, | |
| "learning_rate": 9.687368421052632e-06, | |
| "loss": 0.3582, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 2.390369176864624, | |
| "learning_rate": 9.661052631578948e-06, | |
| "loss": 0.3468, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 2.3737587928771973, | |
| "learning_rate": 9.634736842105265e-06, | |
| "loss": 0.3445, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 2.4866981506347656, | |
| "learning_rate": 9.60842105263158e-06, | |
| "loss": 0.3341, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 2.2460451126098633, | |
| "learning_rate": 9.582105263157897e-06, | |
| "loss": 0.3253, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 2.3266069889068604, | |
| "learning_rate": 9.555789473684211e-06, | |
| "loss": 0.3278, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 2.203608274459839, | |
| "learning_rate": 9.529473684210528e-06, | |
| "loss": 0.3218, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 2.13688063621521, | |
| "learning_rate": 9.503157894736843e-06, | |
| "loss": 0.3183, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 2.313721179962158, | |
| "learning_rate": 9.476842105263158e-06, | |
| "loss": 0.3117, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "eval_loss": 0.5081741809844971, | |
| "eval_runtime": 21.6341, | |
| "eval_samples_per_second": 78.164, | |
| "eval_steps_per_second": 0.647, | |
| "eval_wer": 37.14874484825778, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 2.4097204208374023, | |
| "learning_rate": 9.450526315789475e-06, | |
| "loss": 0.308, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 2.286888599395752, | |
| "learning_rate": 9.42421052631579e-06, | |
| "loss": 0.3042, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 2.2226040363311768, | |
| "learning_rate": 9.397894736842106e-06, | |
| "loss": 0.3014, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 2.1482009887695312, | |
| "learning_rate": 9.371578947368421e-06, | |
| "loss": 0.295, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 2.2194724082946777, | |
| "learning_rate": 9.345263157894738e-06, | |
| "loss": 0.2911, | |
| "step": 1125 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 2.2383620738983154, | |
| "learning_rate": 9.318947368421053e-06, | |
| "loss": 0.2925, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 2.307551145553589, | |
| "learning_rate": 9.292631578947368e-06, | |
| "loss": 0.2834, | |
| "step": 1175 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 2.0051376819610596, | |
| "learning_rate": 9.266315789473685e-06, | |
| "loss": 0.2778, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 2.2903966903686523, | |
| "learning_rate": 9.240000000000001e-06, | |
| "loss": 0.2828, | |
| "step": 1225 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 2.056866407394409, | |
| "learning_rate": 9.213684210526316e-06, | |
| "loss": 0.2757, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 2.2591381072998047, | |
| "learning_rate": 9.187368421052633e-06, | |
| "loss": 0.2742, | |
| "step": 1275 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 2.1059749126434326, | |
| "learning_rate": 9.161052631578948e-06, | |
| "loss": 0.2694, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 2.204620838165283, | |
| "learning_rate": 9.134736842105265e-06, | |
| "loss": 0.2675, | |
| "step": 1325 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 2.11024808883667, | |
| "learning_rate": 9.10842105263158e-06, | |
| "loss": 0.2657, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 2.131837844848633, | |
| "learning_rate": 9.082105263157896e-06, | |
| "loss": 0.2635, | |
| "step": 1375 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 2.171182870864868, | |
| "learning_rate": 9.055789473684211e-06, | |
| "loss": 0.2592, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 2.0435309410095215, | |
| "learning_rate": 9.029473684210526e-06, | |
| "loss": 0.2584, | |
| "step": 1425 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 2.009622573852539, | |
| "learning_rate": 9.003157894736843e-06, | |
| "loss": 0.2615, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 2.5420186519622803, | |
| "learning_rate": 8.976842105263158e-06, | |
| "loss": 0.2598, | |
| "step": 1475 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 2.2081310749053955, | |
| "learning_rate": 8.950526315789474e-06, | |
| "loss": 0.2552, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "eval_loss": 0.4230075776576996, | |
| "eval_runtime": 15.907, | |
| "eval_samples_per_second": 106.306, | |
| "eval_steps_per_second": 0.88, | |
| "eval_wer": 30.26102160609467, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 2.008251905441284, | |
| "learning_rate": 8.92421052631579e-06, | |
| "loss": 0.2425, | |
| "step": 1525 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 1.9225270748138428, | |
| "learning_rate": 8.897894736842106e-06, | |
| "loss": 0.2319, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 1.8944556713104248, | |
| "learning_rate": 8.871578947368423e-06, | |
| "loss": 0.2306, | |
| "step": 1575 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 1.915433645248413, | |
| "learning_rate": 8.845263157894738e-06, | |
| "loss": 0.2331, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 2.067833662033081, | |
| "learning_rate": 8.818947368421054e-06, | |
| "loss": 0.2327, | |
| "step": 1625 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 2.1529483795166016, | |
| "learning_rate": 8.79263157894737e-06, | |
| "loss": 0.2285, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 2.0223615169525146, | |
| "learning_rate": 8.766315789473684e-06, | |
| "loss": 0.2258, | |
| "step": 1675 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 2.064879894256592, | |
| "learning_rate": 8.740000000000001e-06, | |
| "loss": 0.2261, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.14, | |
| "grad_norm": 2.033409595489502, | |
| "learning_rate": 8.713684210526316e-06, | |
| "loss": 0.2266, | |
| "step": 1725 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 1.8101595640182495, | |
| "learning_rate": 8.687368421052633e-06, | |
| "loss": 0.2248, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 2.1755690574645996, | |
| "learning_rate": 8.661052631578948e-06, | |
| "loss": 0.2184, | |
| "step": 1775 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 1.8470789194107056, | |
| "learning_rate": 8.634736842105264e-06, | |
| "loss": 0.2205, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 2.2927639484405518, | |
| "learning_rate": 8.60842105263158e-06, | |
| "loss": 0.2173, | |
| "step": 1825 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 1.9602240324020386, | |
| "learning_rate": 8.582105263157894e-06, | |
| "loss": 0.2169, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 1.941825270652771, | |
| "learning_rate": 8.555789473684213e-06, | |
| "loss": 0.2131, | |
| "step": 1875 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 2.0443484783172607, | |
| "learning_rate": 8.529473684210528e-06, | |
| "loss": 0.2151, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 1.8085869550704956, | |
| "learning_rate": 8.503157894736843e-06, | |
| "loss": 0.2168, | |
| "step": 1925 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 1.8386337757110596, | |
| "learning_rate": 8.47684210526316e-06, | |
| "loss": 0.214, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 2.097592830657959, | |
| "learning_rate": 8.450526315789474e-06, | |
| "loss": 0.2106, | |
| "step": 1975 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 2.083630323410034, | |
| "learning_rate": 8.42421052631579e-06, | |
| "loss": 0.2102, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "eval_loss": 0.3910539448261261, | |
| "eval_runtime": 16.2845, | |
| "eval_samples_per_second": 103.841, | |
| "eval_steps_per_second": 0.86, | |
| "eval_wer": 28.606219557886845, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 1.8663444519042969, | |
| "learning_rate": 8.397894736842106e-06, | |
| "loss": 0.2077, | |
| "step": 2025 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 1.958034873008728, | |
| "learning_rate": 8.371578947368422e-06, | |
| "loss": 0.2102, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 1.7769043445587158, | |
| "learning_rate": 8.345263157894737e-06, | |
| "loss": 0.2055, | |
| "step": 2075 | |
| }, | |
| { | |
| "epoch": 1.39, | |
| "grad_norm": 1.8657371997833252, | |
| "learning_rate": 8.318947368421052e-06, | |
| "loss": 0.2073, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 2.0003774166107178, | |
| "learning_rate": 8.292631578947369e-06, | |
| "loss": 0.2094, | |
| "step": 2125 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 1.8350632190704346, | |
| "learning_rate": 8.266315789473684e-06, | |
| "loss": 0.2027, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 2.0300979614257812, | |
| "learning_rate": 8.24e-06, | |
| "loss": 0.2082, | |
| "step": 2175 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 2.034996747970581, | |
| "learning_rate": 8.213684210526316e-06, | |
| "loss": 0.206, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 1.8040868043899536, | |
| "learning_rate": 8.187368421052632e-06, | |
| "loss": 0.1994, | |
| "step": 2225 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 1.9792579412460327, | |
| "learning_rate": 8.161052631578949e-06, | |
| "loss": 0.1985, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 2.0966882705688477, | |
| "learning_rate": 8.134736842105264e-06, | |
| "loss": 0.1989, | |
| "step": 2275 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 1.958456039428711, | |
| "learning_rate": 8.10842105263158e-06, | |
| "loss": 0.204, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 1.7953109741210938, | |
| "learning_rate": 8.082105263157896e-06, | |
| "loss": 0.1953, | |
| "step": 2325 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 1.8202308416366577, | |
| "learning_rate": 8.05578947368421e-06, | |
| "loss": 0.2001, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 1.57, | |
| "grad_norm": 1.690443754196167, | |
| "learning_rate": 8.029473684210527e-06, | |
| "loss": 0.1964, | |
| "step": 2375 | |
| }, | |
| { | |
| "epoch": 1.59, | |
| "grad_norm": 1.8226059675216675, | |
| "learning_rate": 8.003157894736842e-06, | |
| "loss": 0.1949, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 1.7331619262695312, | |
| "learning_rate": 7.976842105263159e-06, | |
| "loss": 0.1946, | |
| "step": 2425 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 1.9106403589248657, | |
| "learning_rate": 7.950526315789474e-06, | |
| "loss": 0.191, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 1.8373783826828003, | |
| "learning_rate": 7.92421052631579e-06, | |
| "loss": 0.1903, | |
| "step": 2475 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 1.9064444303512573, | |
| "learning_rate": 7.897894736842106e-06, | |
| "loss": 0.1925, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "eval_loss": 0.37334463000297546, | |
| "eval_runtime": 14.6238, | |
| "eval_samples_per_second": 115.634, | |
| "eval_steps_per_second": 0.957, | |
| "eval_wer": 26.745347820656924, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 1.888606071472168, | |
| "learning_rate": 7.87157894736842e-06, | |
| "loss": 0.1907, | |
| "step": 2525 | |
| }, | |
| { | |
| "epoch": 1.68, | |
| "grad_norm": 1.7304494380950928, | |
| "learning_rate": 7.845263157894739e-06, | |
| "loss": 0.1906, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 1.856978416442871, | |
| "learning_rate": 7.818947368421054e-06, | |
| "loss": 0.1866, | |
| "step": 2575 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 1.7459311485290527, | |
| "learning_rate": 7.792631578947369e-06, | |
| "loss": 0.1904, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 1.777932047843933, | |
| "learning_rate": 7.766315789473685e-06, | |
| "loss": 0.1895, | |
| "step": 2625 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 1.8538662195205688, | |
| "learning_rate": 7.74e-06, | |
| "loss": 0.186, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 1.790150761604309, | |
| "learning_rate": 7.713684210526317e-06, | |
| "loss": 0.1858, | |
| "step": 2675 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 1.7638112306594849, | |
| "learning_rate": 7.687368421052632e-06, | |
| "loss": 0.1885, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 1.9235881567001343, | |
| "learning_rate": 7.661052631578949e-06, | |
| "loss": 0.1869, | |
| "step": 2725 | |
| }, | |
| { | |
| "epoch": 1.82, | |
| "grad_norm": 1.7366169691085815, | |
| "learning_rate": 7.634736842105264e-06, | |
| "loss": 0.1838, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 1.7510082721710205, | |
| "learning_rate": 7.6084210526315795e-06, | |
| "loss": 0.1856, | |
| "step": 2775 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 1.8957219123840332, | |
| "learning_rate": 7.582105263157895e-06, | |
| "loss": 0.1866, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 1.7200273275375366, | |
| "learning_rate": 7.555789473684211e-06, | |
| "loss": 0.1831, | |
| "step": 2825 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 1.9370934963226318, | |
| "learning_rate": 7.529473684210526e-06, | |
| "loss": 0.1831, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 1.6578595638275146, | |
| "learning_rate": 7.503157894736842e-06, | |
| "loss": 0.1826, | |
| "step": 2875 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 1.7850892543792725, | |
| "learning_rate": 7.476842105263159e-06, | |
| "loss": 0.1787, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 1.93, | |
| "grad_norm": 1.7334098815917969, | |
| "learning_rate": 7.4505263157894744e-06, | |
| "loss": 0.18, | |
| "step": 2925 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 1.7443405389785767, | |
| "learning_rate": 7.42421052631579e-06, | |
| "loss": 0.1776, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 1.7523411512374878, | |
| "learning_rate": 7.397894736842106e-06, | |
| "loss": 0.1811, | |
| "step": 2975 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 1.8293405771255493, | |
| "learning_rate": 7.371578947368422e-06, | |
| "loss": 0.1768, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "eval_loss": 0.35854896903038025, | |
| "eval_runtime": 14.7913, | |
| "eval_samples_per_second": 114.324, | |
| "eval_steps_per_second": 0.947, | |
| "eval_wer": 24.96565505182965, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 1.6644916534423828, | |
| "learning_rate": 7.345263157894738e-06, | |
| "loss": 0.1776, | |
| "step": 3025 | |
| }, | |
| { | |
| "epoch": 2.01, | |
| "grad_norm": 1.7578173875808716, | |
| "learning_rate": 7.3189473684210535e-06, | |
| "loss": 0.1698, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 2.03, | |
| "grad_norm": 1.7905900478363037, | |
| "learning_rate": 7.292631578947369e-06, | |
| "loss": 0.1691, | |
| "step": 3075 | |
| }, | |
| { | |
| "epoch": 2.05, | |
| "grad_norm": 1.583471655845642, | |
| "learning_rate": 7.266315789473684e-06, | |
| "loss": 0.1668, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 2.06, | |
| "grad_norm": 1.7078475952148438, | |
| "learning_rate": 7.24e-06, | |
| "loss": 0.1624, | |
| "step": 3125 | |
| }, | |
| { | |
| "epoch": 2.08, | |
| "grad_norm": 1.8642972707748413, | |
| "learning_rate": 7.213684210526316e-06, | |
| "loss": 0.1645, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 2.1, | |
| "grad_norm": 1.739005446434021, | |
| "learning_rate": 7.187368421052632e-06, | |
| "loss": 0.162, | |
| "step": 3175 | |
| }, | |
| { | |
| "epoch": 2.11, | |
| "grad_norm": 1.7232236862182617, | |
| "learning_rate": 7.161052631578948e-06, | |
| "loss": 0.1649, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 2.13, | |
| "grad_norm": 1.9032922983169556, | |
| "learning_rate": 7.134736842105264e-06, | |
| "loss": 0.1584, | |
| "step": 3225 | |
| }, | |
| { | |
| "epoch": 2.15, | |
| "grad_norm": 1.8413559198379517, | |
| "learning_rate": 7.10842105263158e-06, | |
| "loss": 0.1582, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 2.16, | |
| "grad_norm": 1.672963261604309, | |
| "learning_rate": 7.082105263157896e-06, | |
| "loss": 0.1648, | |
| "step": 3275 | |
| }, | |
| { | |
| "epoch": 2.18, | |
| "grad_norm": 1.9063982963562012, | |
| "learning_rate": 7.055789473684212e-06, | |
| "loss": 0.1621, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 1.7335928678512573, | |
| "learning_rate": 7.0294736842105275e-06, | |
| "loss": 0.1593, | |
| "step": 3325 | |
| }, | |
| { | |
| "epoch": 2.21, | |
| "grad_norm": 1.6883697509765625, | |
| "learning_rate": 7.0031578947368425e-06, | |
| "loss": 0.1613, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 2.23, | |
| "grad_norm": 1.6064486503601074, | |
| "learning_rate": 6.976842105263158e-06, | |
| "loss": 0.1602, | |
| "step": 3375 | |
| }, | |
| { | |
| "epoch": 2.25, | |
| "grad_norm": 1.62557852268219, | |
| "learning_rate": 6.950526315789474e-06, | |
| "loss": 0.1574, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 2.26, | |
| "grad_norm": 1.7775442600250244, | |
| "learning_rate": 6.92421052631579e-06, | |
| "loss": 0.1563, | |
| "step": 3425 | |
| }, | |
| { | |
| "epoch": 2.28, | |
| "grad_norm": 1.6719475984573364, | |
| "learning_rate": 6.897894736842106e-06, | |
| "loss": 0.162, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 2.3, | |
| "grad_norm": 1.8289706707000732, | |
| "learning_rate": 6.871578947368422e-06, | |
| "loss": 0.1653, | |
| "step": 3475 | |
| }, | |
| { | |
| "epoch": 2.31, | |
| "grad_norm": 1.6735001802444458, | |
| "learning_rate": 6.845263157894737e-06, | |
| "loss": 0.1572, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.31, | |
| "eval_loss": 0.35393840074539185, | |
| "eval_runtime": 15.9677, | |
| "eval_samples_per_second": 105.901, | |
| "eval_steps_per_second": 0.877, | |
| "eval_wer": 25.346571749718994, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.33, | |
| "grad_norm": 1.6916478872299194, | |
| "learning_rate": 6.818947368421052e-06, | |
| "loss": 0.1514, | |
| "step": 3525 | |
| }, | |
| { | |
| "epoch": 2.34, | |
| "grad_norm": 1.6720538139343262, | |
| "learning_rate": 6.792631578947368e-06, | |
| "loss": 0.1579, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 2.36, | |
| "grad_norm": 1.7501777410507202, | |
| "learning_rate": 6.766315789473685e-06, | |
| "loss": 0.1566, | |
| "step": 3575 | |
| }, | |
| { | |
| "epoch": 2.38, | |
| "grad_norm": 1.8388835191726685, | |
| "learning_rate": 6.740000000000001e-06, | |
| "loss": 0.1591, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 2.39, | |
| "grad_norm": 1.8639742136001587, | |
| "learning_rate": 6.7136842105263165e-06, | |
| "loss": 0.156, | |
| "step": 3625 | |
| }, | |
| { | |
| "epoch": 2.41, | |
| "grad_norm": 1.8133294582366943, | |
| "learning_rate": 6.687368421052632e-06, | |
| "loss": 0.16, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 2.43, | |
| "grad_norm": 1.734179139137268, | |
| "learning_rate": 6.661052631578948e-06, | |
| "loss": 0.1546, | |
| "step": 3675 | |
| }, | |
| { | |
| "epoch": 2.44, | |
| "grad_norm": 1.736973524093628, | |
| "learning_rate": 6.634736842105264e-06, | |
| "loss": 0.1554, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 2.46, | |
| "grad_norm": 1.5530760288238525, | |
| "learning_rate": 6.60842105263158e-06, | |
| "loss": 0.1547, | |
| "step": 3725 | |
| }, | |
| { | |
| "epoch": 2.48, | |
| "grad_norm": 1.634820580482483, | |
| "learning_rate": 6.582105263157896e-06, | |
| "loss": 0.1542, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 2.49, | |
| "grad_norm": 1.5735784769058228, | |
| "learning_rate": 6.5557894736842106e-06, | |
| "loss": 0.1579, | |
| "step": 3775 | |
| }, | |
| { | |
| "epoch": 2.51, | |
| "grad_norm": 1.7229827642440796, | |
| "learning_rate": 6.529473684210526e-06, | |
| "loss": 0.1536, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.53, | |
| "grad_norm": 1.6279429197311401, | |
| "learning_rate": 6.503157894736842e-06, | |
| "loss": 0.1518, | |
| "step": 3825 | |
| }, | |
| { | |
| "epoch": 2.54, | |
| "grad_norm": 1.5785133838653564, | |
| "learning_rate": 6.476842105263158e-06, | |
| "loss": 0.1488, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 2.56, | |
| "grad_norm": 1.494593620300293, | |
| "learning_rate": 6.450526315789474e-06, | |
| "loss": 0.1525, | |
| "step": 3875 | |
| }, | |
| { | |
| "epoch": 2.58, | |
| "grad_norm": 1.7033801078796387, | |
| "learning_rate": 6.42421052631579e-06, | |
| "loss": 0.1539, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 2.59, | |
| "grad_norm": 1.574308156967163, | |
| "learning_rate": 6.397894736842106e-06, | |
| "loss": 0.1488, | |
| "step": 3925 | |
| }, | |
| { | |
| "epoch": 2.61, | |
| "grad_norm": 1.597985863685608, | |
| "learning_rate": 6.371578947368422e-06, | |
| "loss": 0.1528, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 2.63, | |
| "grad_norm": 1.7028511762619019, | |
| "learning_rate": 6.345263157894738e-06, | |
| "loss": 0.1549, | |
| "step": 3975 | |
| }, | |
| { | |
| "epoch": 2.64, | |
| "grad_norm": 1.7545559406280518, | |
| "learning_rate": 6.318947368421054e-06, | |
| "loss": 0.1503, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.64, | |
| "eval_loss": 0.3429431915283203, | |
| "eval_runtime": 15.347, | |
| "eval_samples_per_second": 110.185, | |
| "eval_steps_per_second": 0.912, | |
| "eval_wer": 24.19133258398901, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.66, | |
| "grad_norm": 1.7337292432785034, | |
| "learning_rate": 6.292631578947369e-06, | |
| "loss": 0.1538, | |
| "step": 4025 | |
| }, | |
| { | |
| "epoch": 2.68, | |
| "grad_norm": 1.7260130643844604, | |
| "learning_rate": 6.266315789473685e-06, | |
| "loss": 0.1501, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 2.69, | |
| "grad_norm": 1.6987520456314087, | |
| "learning_rate": 6.24e-06, | |
| "loss": 0.1542, | |
| "step": 4075 | |
| }, | |
| { | |
| "epoch": 2.71, | |
| "grad_norm": 1.781073808670044, | |
| "learning_rate": 6.213684210526316e-06, | |
| "loss": 0.1534, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 2.72, | |
| "grad_norm": 1.6806445121765137, | |
| "learning_rate": 6.187368421052632e-06, | |
| "loss": 0.147, | |
| "step": 4125 | |
| }, | |
| { | |
| "epoch": 2.74, | |
| "grad_norm": 1.4836201667785645, | |
| "learning_rate": 6.161052631578948e-06, | |
| "loss": 0.1509, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 2.76, | |
| "grad_norm": 1.7774155139923096, | |
| "learning_rate": 6.134736842105264e-06, | |
| "loss": 0.1519, | |
| "step": 4175 | |
| }, | |
| { | |
| "epoch": 2.77, | |
| "grad_norm": 1.613662600517273, | |
| "learning_rate": 6.108421052631579e-06, | |
| "loss": 0.15, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 2.79, | |
| "grad_norm": 1.713094711303711, | |
| "learning_rate": 6.0821052631578945e-06, | |
| "loss": 0.1481, | |
| "step": 4225 | |
| }, | |
| { | |
| "epoch": 2.81, | |
| "grad_norm": 1.7286796569824219, | |
| "learning_rate": 6.055789473684212e-06, | |
| "loss": 0.15, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 2.82, | |
| "grad_norm": 1.566652774810791, | |
| "learning_rate": 6.029473684210527e-06, | |
| "loss": 0.147, | |
| "step": 4275 | |
| }, | |
| { | |
| "epoch": 2.84, | |
| "grad_norm": 1.7226457595825195, | |
| "learning_rate": 6.003157894736843e-06, | |
| "loss": 0.1474, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 2.86, | |
| "grad_norm": 1.82681405544281, | |
| "learning_rate": 5.976842105263159e-06, | |
| "loss": 0.1518, | |
| "step": 4325 | |
| }, | |
| { | |
| "epoch": 2.87, | |
| "grad_norm": 1.8655240535736084, | |
| "learning_rate": 5.950526315789474e-06, | |
| "loss": 0.1449, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 2.89, | |
| "grad_norm": 1.6956390142440796, | |
| "learning_rate": 5.92421052631579e-06, | |
| "loss": 0.149, | |
| "step": 4375 | |
| }, | |
| { | |
| "epoch": 2.91, | |
| "grad_norm": 1.6391839981079102, | |
| "learning_rate": 5.897894736842106e-06, | |
| "loss": 0.1494, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 2.92, | |
| "grad_norm": 1.7154439687728882, | |
| "learning_rate": 5.871578947368422e-06, | |
| "loss": 0.1464, | |
| "step": 4425 | |
| }, | |
| { | |
| "epoch": 2.94, | |
| "grad_norm": 1.708503246307373, | |
| "learning_rate": 5.845263157894737e-06, | |
| "loss": 0.1473, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 2.96, | |
| "grad_norm": 1.6649551391601562, | |
| "learning_rate": 5.818947368421053e-06, | |
| "loss": 0.1467, | |
| "step": 4475 | |
| }, | |
| { | |
| "epoch": 2.97, | |
| "grad_norm": 1.6294652223587036, | |
| "learning_rate": 5.7926315789473685e-06, | |
| "loss": 0.1485, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.97, | |
| "eval_loss": 0.3344377875328064, | |
| "eval_runtime": 14.5388, | |
| "eval_samples_per_second": 116.31, | |
| "eval_steps_per_second": 0.963, | |
| "eval_wer": 22.904958161608594, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.99, | |
| "grad_norm": 1.691629409790039, | |
| "learning_rate": 5.766315789473684e-06, | |
| "loss": 0.1448, | |
| "step": 4525 | |
| }, | |
| { | |
| "epoch": 3.01, | |
| "grad_norm": 1.4993510246276855, | |
| "learning_rate": 5.74e-06, | |
| "loss": 0.1406, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 3.02, | |
| "grad_norm": 1.5252876281738281, | |
| "learning_rate": 5.713684210526316e-06, | |
| "loss": 0.1366, | |
| "step": 4575 | |
| }, | |
| { | |
| "epoch": 3.04, | |
| "grad_norm": 1.4705634117126465, | |
| "learning_rate": 5.687368421052633e-06, | |
| "loss": 0.1355, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 3.05, | |
| "grad_norm": 1.661219596862793, | |
| "learning_rate": 5.661052631578948e-06, | |
| "loss": 0.1354, | |
| "step": 4625 | |
| }, | |
| { | |
| "epoch": 3.07, | |
| "grad_norm": 1.7826298475265503, | |
| "learning_rate": 5.634736842105264e-06, | |
| "loss": 0.1369, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 3.09, | |
| "grad_norm": 1.7129111289978027, | |
| "learning_rate": 5.60842105263158e-06, | |
| "loss": 0.1359, | |
| "step": 4675 | |
| }, | |
| { | |
| "epoch": 3.1, | |
| "grad_norm": 1.5526037216186523, | |
| "learning_rate": 5.582105263157895e-06, | |
| "loss": 0.1355, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 3.12, | |
| "grad_norm": 1.690327763557434, | |
| "learning_rate": 5.555789473684211e-06, | |
| "loss": 0.1346, | |
| "step": 4725 | |
| }, | |
| { | |
| "epoch": 3.14, | |
| "grad_norm": 1.5185409784317017, | |
| "learning_rate": 5.529473684210527e-06, | |
| "loss": 0.1323, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 3.15, | |
| "grad_norm": 1.617923617362976, | |
| "learning_rate": 5.5031578947368425e-06, | |
| "loss": 0.1366, | |
| "step": 4775 | |
| }, | |
| { | |
| "epoch": 3.17, | |
| "grad_norm": 1.6980522871017456, | |
| "learning_rate": 5.476842105263158e-06, | |
| "loss": 0.136, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 3.19, | |
| "grad_norm": 1.5043766498565674, | |
| "learning_rate": 5.450526315789474e-06, | |
| "loss": 0.1339, | |
| "step": 4825 | |
| }, | |
| { | |
| "epoch": 3.2, | |
| "grad_norm": 1.8342564105987549, | |
| "learning_rate": 5.42421052631579e-06, | |
| "loss": 0.135, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 3.22, | |
| "grad_norm": 1.4562426805496216, | |
| "learning_rate": 5.397894736842105e-06, | |
| "loss": 0.1359, | |
| "step": 4875 | |
| }, | |
| { | |
| "epoch": 3.24, | |
| "grad_norm": 1.6603587865829468, | |
| "learning_rate": 5.371578947368421e-06, | |
| "loss": 0.13, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 3.25, | |
| "grad_norm": 1.5824819803237915, | |
| "learning_rate": 5.345263157894738e-06, | |
| "loss": 0.1332, | |
| "step": 4925 | |
| }, | |
| { | |
| "epoch": 3.27, | |
| "grad_norm": 1.6331573724746704, | |
| "learning_rate": 5.318947368421053e-06, | |
| "loss": 0.132, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 3.29, | |
| "grad_norm": 1.6373783349990845, | |
| "learning_rate": 5.292631578947369e-06, | |
| "loss": 0.1376, | |
| "step": 4975 | |
| }, | |
| { | |
| "epoch": 3.3, | |
| "grad_norm": 1.617693305015564, | |
| "learning_rate": 5.266315789473685e-06, | |
| "loss": 0.131, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 3.3, | |
| "eval_loss": 0.3334658145904541, | |
| "eval_runtime": 14.2594, | |
| "eval_samples_per_second": 118.588, | |
| "eval_steps_per_second": 0.982, | |
| "eval_wer": 22.979892593980267, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 3.32, | |
| "grad_norm": 1.6260693073272705, | |
| "learning_rate": 5.240000000000001e-06, | |
| "loss": 0.1321, | |
| "step": 5025 | |
| }, | |
| { | |
| "epoch": 3.34, | |
| "grad_norm": 1.679488182067871, | |
| "learning_rate": 5.2136842105263165e-06, | |
| "loss": 0.1345, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 3.35, | |
| "grad_norm": 1.550234079360962, | |
| "learning_rate": 5.187368421052632e-06, | |
| "loss": 0.1299, | |
| "step": 5075 | |
| }, | |
| { | |
| "epoch": 3.37, | |
| "grad_norm": 1.5804076194763184, | |
| "learning_rate": 5.161052631578948e-06, | |
| "loss": 0.1348, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 3.39, | |
| "grad_norm": 1.7430262565612793, | |
| "learning_rate": 5.134736842105263e-06, | |
| "loss": 0.1329, | |
| "step": 5125 | |
| }, | |
| { | |
| "epoch": 3.4, | |
| "grad_norm": 1.6812238693237305, | |
| "learning_rate": 5.108421052631579e-06, | |
| "loss": 0.1343, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 3.42, | |
| "grad_norm": 1.6852658987045288, | |
| "learning_rate": 5.082105263157895e-06, | |
| "loss": 0.1321, | |
| "step": 5175 | |
| }, | |
| { | |
| "epoch": 3.43, | |
| "grad_norm": 1.7165955305099487, | |
| "learning_rate": 5.0557894736842105e-06, | |
| "loss": 0.133, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 3.45, | |
| "grad_norm": 1.722699522972107, | |
| "learning_rate": 5.029473684210526e-06, | |
| "loss": 0.129, | |
| "step": 5225 | |
| }, | |
| { | |
| "epoch": 3.47, | |
| "grad_norm": 1.7014281749725342, | |
| "learning_rate": 5.003157894736842e-06, | |
| "loss": 0.1325, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 3.48, | |
| "grad_norm": 1.8094806671142578, | |
| "learning_rate": 4.976842105263158e-06, | |
| "loss": 0.1312, | |
| "step": 5275 | |
| }, | |
| { | |
| "epoch": 3.5, | |
| "grad_norm": 1.600211262702942, | |
| "learning_rate": 4.950526315789474e-06, | |
| "loss": 0.1284, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 3.52, | |
| "grad_norm": 1.5237622261047363, | |
| "learning_rate": 4.92421052631579e-06, | |
| "loss": 0.1297, | |
| "step": 5325 | |
| }, | |
| { | |
| "epoch": 3.53, | |
| "grad_norm": 1.542418122291565, | |
| "learning_rate": 4.897894736842106e-06, | |
| "loss": 0.1317, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 3.55, | |
| "grad_norm": 1.639620065689087, | |
| "learning_rate": 4.871578947368421e-06, | |
| "loss": 0.132, | |
| "step": 5375 | |
| }, | |
| { | |
| "epoch": 3.57, | |
| "grad_norm": 1.6733545064926147, | |
| "learning_rate": 4.845263157894737e-06, | |
| "loss": 0.1308, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 3.58, | |
| "grad_norm": 1.700808048248291, | |
| "learning_rate": 4.818947368421053e-06, | |
| "loss": 0.1305, | |
| "step": 5425 | |
| }, | |
| { | |
| "epoch": 3.6, | |
| "grad_norm": 1.4252574443817139, | |
| "learning_rate": 4.792631578947369e-06, | |
| "loss": 0.1296, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 3.62, | |
| "grad_norm": 1.7240992784500122, | |
| "learning_rate": 4.7663157894736845e-06, | |
| "loss": 0.1339, | |
| "step": 5475 | |
| }, | |
| { | |
| "epoch": 3.63, | |
| "grad_norm": 1.6297061443328857, | |
| "learning_rate": 4.74e-06, | |
| "loss": 0.1294, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 3.63, | |
| "eval_loss": 0.3302935063838959, | |
| "eval_runtime": 17.4619, | |
| "eval_samples_per_second": 96.839, | |
| "eval_steps_per_second": 0.802, | |
| "eval_wer": 23.179717746971402, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 3.65, | |
| "grad_norm": 1.5596210956573486, | |
| "learning_rate": 4.713684210526316e-06, | |
| "loss": 0.1296, | |
| "step": 5525 | |
| }, | |
| { | |
| "epoch": 3.67, | |
| "grad_norm": 1.6876928806304932, | |
| "learning_rate": 4.687368421052632e-06, | |
| "loss": 0.1268, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 3.68, | |
| "grad_norm": 1.5455940961837769, | |
| "learning_rate": 4.661052631578948e-06, | |
| "loss": 0.129, | |
| "step": 5575 | |
| }, | |
| { | |
| "epoch": 3.7, | |
| "grad_norm": 1.594913125038147, | |
| "learning_rate": 4.634736842105264e-06, | |
| "loss": 0.1274, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 3.72, | |
| "grad_norm": 1.5149903297424316, | |
| "learning_rate": 4.6084210526315794e-06, | |
| "loss": 0.1306, | |
| "step": 5625 | |
| }, | |
| { | |
| "epoch": 3.73, | |
| "grad_norm": 1.661870002746582, | |
| "learning_rate": 4.582105263157895e-06, | |
| "loss": 0.1334, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 3.75, | |
| "grad_norm": 1.7134344577789307, | |
| "learning_rate": 4.55578947368421e-06, | |
| "loss": 0.1264, | |
| "step": 5675 | |
| }, | |
| { | |
| "epoch": 3.76, | |
| "grad_norm": 1.5931401252746582, | |
| "learning_rate": 4.529473684210527e-06, | |
| "loss": 0.1291, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 3.78, | |
| "grad_norm": 1.6768360137939453, | |
| "learning_rate": 4.503157894736843e-06, | |
| "loss": 0.128, | |
| "step": 5725 | |
| }, | |
| { | |
| "epoch": 3.8, | |
| "grad_norm": 1.5798521041870117, | |
| "learning_rate": 4.4768421052631585e-06, | |
| "loss": 0.1255, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 3.81, | |
| "grad_norm": 1.5002096891403198, | |
| "learning_rate": 4.450526315789474e-06, | |
| "loss": 0.1275, | |
| "step": 5775 | |
| }, | |
| { | |
| "epoch": 3.83, | |
| "grad_norm": 1.6101495027542114, | |
| "learning_rate": 4.424210526315789e-06, | |
| "loss": 0.1279, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 3.85, | |
| "grad_norm": 1.5645090341567993, | |
| "learning_rate": 4.397894736842105e-06, | |
| "loss": 0.1337, | |
| "step": 5825 | |
| }, | |
| { | |
| "epoch": 3.86, | |
| "grad_norm": 1.6023365259170532, | |
| "learning_rate": 4.371578947368421e-06, | |
| "loss": 0.1285, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 3.88, | |
| "grad_norm": 1.4570146799087524, | |
| "learning_rate": 4.345263157894738e-06, | |
| "loss": 0.1279, | |
| "step": 5875 | |
| }, | |
| { | |
| "epoch": 3.9, | |
| "grad_norm": 1.6708632707595825, | |
| "learning_rate": 4.3189473684210535e-06, | |
| "loss": 0.1276, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 3.91, | |
| "grad_norm": 1.553534746170044, | |
| "learning_rate": 4.2926315789473684e-06, | |
| "loss": 0.1311, | |
| "step": 5925 | |
| }, | |
| { | |
| "epoch": 3.93, | |
| "grad_norm": 1.6338897943496704, | |
| "learning_rate": 4.266315789473684e-06, | |
| "loss": 0.1258, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 3.95, | |
| "grad_norm": 1.5521620512008667, | |
| "learning_rate": 4.24e-06, | |
| "loss": 0.1278, | |
| "step": 5975 | |
| }, | |
| { | |
| "epoch": 3.96, | |
| "grad_norm": 1.508652925491333, | |
| "learning_rate": 4.213684210526316e-06, | |
| "loss": 0.1287, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 3.96, | |
| "eval_loss": 0.3290025293827057, | |
| "eval_runtime": 15.8008, | |
| "eval_samples_per_second": 107.02, | |
| "eval_steps_per_second": 0.886, | |
| "eval_wer": 23.073560634444863, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 3.98, | |
| "grad_norm": 1.6393396854400635, | |
| "learning_rate": 4.1873684210526325e-06, | |
| "loss": 0.1276, | |
| "step": 6025 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 1.571065902709961, | |
| "learning_rate": 4.1610526315789475e-06, | |
| "loss": 0.1261, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 4.01, | |
| "grad_norm": 1.5454843044281006, | |
| "learning_rate": 4.134736842105263e-06, | |
| "loss": 0.12, | |
| "step": 6075 | |
| }, | |
| { | |
| "epoch": 4.03, | |
| "grad_norm": 1.5475822687149048, | |
| "learning_rate": 4.108421052631579e-06, | |
| "loss": 0.1226, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 4.05, | |
| "grad_norm": 1.4355708360671997, | |
| "learning_rate": 4.082105263157895e-06, | |
| "loss": 0.1216, | |
| "step": 6125 | |
| }, | |
| { | |
| "epoch": 4.06, | |
| "grad_norm": 1.546095848083496, | |
| "learning_rate": 4.055789473684211e-06, | |
| "loss": 0.1202, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 4.08, | |
| "grad_norm": 1.5846285820007324, | |
| "learning_rate": 4.029473684210527e-06, | |
| "loss": 0.1174, | |
| "step": 6175 | |
| }, | |
| { | |
| "epoch": 4.1, | |
| "grad_norm": 1.6201484203338623, | |
| "learning_rate": 4.0031578947368424e-06, | |
| "loss": 0.1202, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 4.11, | |
| "grad_norm": 1.5635933876037598, | |
| "learning_rate": 3.976842105263158e-06, | |
| "loss": 0.1179, | |
| "step": 6225 | |
| }, | |
| { | |
| "epoch": 4.13, | |
| "grad_norm": 1.5160921812057495, | |
| "learning_rate": 3.950526315789474e-06, | |
| "loss": 0.1184, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 4.14, | |
| "grad_norm": 1.8259953260421753, | |
| "learning_rate": 3.92421052631579e-06, | |
| "loss": 0.1167, | |
| "step": 6275 | |
| }, | |
| { | |
| "epoch": 4.16, | |
| "grad_norm": 1.5983636379241943, | |
| "learning_rate": 3.897894736842106e-06, | |
| "loss": 0.1214, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 4.18, | |
| "grad_norm": 1.5877853631973267, | |
| "learning_rate": 3.8715789473684215e-06, | |
| "loss": 0.1188, | |
| "step": 6325 | |
| }, | |
| { | |
| "epoch": 4.19, | |
| "grad_norm": 1.5386959314346313, | |
| "learning_rate": 3.845263157894737e-06, | |
| "loss": 0.1196, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 4.21, | |
| "grad_norm": 1.8094242811203003, | |
| "learning_rate": 3.818947368421053e-06, | |
| "loss": 0.1199, | |
| "step": 6375 | |
| }, | |
| { | |
| "epoch": 4.23, | |
| "grad_norm": 1.5226629972457886, | |
| "learning_rate": 3.792631578947369e-06, | |
| "loss": 0.1176, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 4.24, | |
| "grad_norm": 1.605747938156128, | |
| "learning_rate": 3.766315789473685e-06, | |
| "loss": 0.1166, | |
| "step": 6425 | |
| }, | |
| { | |
| "epoch": 4.26, | |
| "grad_norm": 1.4122657775878906, | |
| "learning_rate": 3.74e-06, | |
| "loss": 0.1193, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 4.28, | |
| "grad_norm": 1.538041114807129, | |
| "learning_rate": 3.713684210526316e-06, | |
| "loss": 0.1162, | |
| "step": 6475 | |
| }, | |
| { | |
| "epoch": 4.29, | |
| "grad_norm": 1.5662447214126587, | |
| "learning_rate": 3.687368421052632e-06, | |
| "loss": 0.1153, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 4.29, | |
| "eval_loss": 0.3267483413219452, | |
| "eval_runtime": 14.5761, | |
| "eval_samples_per_second": 116.012, | |
| "eval_steps_per_second": 0.96, | |
| "eval_wer": 22.061945797427253, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 4.31, | |
| "grad_norm": 1.511885643005371, | |
| "learning_rate": 3.6610526315789472e-06, | |
| "loss": 0.1197, | |
| "step": 6525 | |
| }, | |
| { | |
| "epoch": 4.33, | |
| "grad_norm": 1.5087144374847412, | |
| "learning_rate": 3.6347368421052635e-06, | |
| "loss": 0.1214, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 4.34, | |
| "grad_norm": 1.5032167434692383, | |
| "learning_rate": 3.6084210526315793e-06, | |
| "loss": 0.1177, | |
| "step": 6575 | |
| }, | |
| { | |
| "epoch": 4.36, | |
| "grad_norm": 1.4949249029159546, | |
| "learning_rate": 3.582105263157895e-06, | |
| "loss": 0.1209, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 4.38, | |
| "grad_norm": 1.6159617900848389, | |
| "learning_rate": 3.555789473684211e-06, | |
| "loss": 0.1204, | |
| "step": 6625 | |
| }, | |
| { | |
| "epoch": 4.39, | |
| "grad_norm": 1.5025402307510376, | |
| "learning_rate": 3.5294736842105263e-06, | |
| "loss": 0.1143, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 4.41, | |
| "grad_norm": 1.4929492473602295, | |
| "learning_rate": 3.503157894736842e-06, | |
| "loss": 0.12, | |
| "step": 6675 | |
| }, | |
| { | |
| "epoch": 4.43, | |
| "grad_norm": 1.6627602577209473, | |
| "learning_rate": 3.476842105263158e-06, | |
| "loss": 0.1176, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 4.44, | |
| "grad_norm": 1.5767234563827515, | |
| "learning_rate": 3.450526315789474e-06, | |
| "loss": 0.1158, | |
| "step": 6725 | |
| }, | |
| { | |
| "epoch": 4.46, | |
| "grad_norm": 1.4062097072601318, | |
| "learning_rate": 3.42421052631579e-06, | |
| "loss": 0.118, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 4.47, | |
| "grad_norm": 1.5933609008789062, | |
| "learning_rate": 3.3978947368421054e-06, | |
| "loss": 0.1178, | |
| "step": 6775 | |
| }, | |
| { | |
| "epoch": 4.49, | |
| "grad_norm": 1.4828532934188843, | |
| "learning_rate": 3.3715789473684212e-06, | |
| "loss": 0.1163, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 4.51, | |
| "grad_norm": 1.4716224670410156, | |
| "learning_rate": 3.345263157894737e-06, | |
| "loss": 0.1154, | |
| "step": 6825 | |
| }, | |
| { | |
| "epoch": 4.52, | |
| "grad_norm": 1.5611412525177002, | |
| "learning_rate": 3.318947368421053e-06, | |
| "loss": 0.1181, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 4.54, | |
| "grad_norm": 1.626551866531372, | |
| "learning_rate": 3.292631578947369e-06, | |
| "loss": 0.1189, | |
| "step": 6875 | |
| }, | |
| { | |
| "epoch": 4.56, | |
| "grad_norm": 1.6640559434890747, | |
| "learning_rate": 3.2663157894736845e-06, | |
| "loss": 0.12, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 4.57, | |
| "grad_norm": 1.5578954219818115, | |
| "learning_rate": 3.2400000000000003e-06, | |
| "loss": 0.1151, | |
| "step": 6925 | |
| }, | |
| { | |
| "epoch": 4.59, | |
| "grad_norm": 1.4524513483047485, | |
| "learning_rate": 3.213684210526316e-06, | |
| "loss": 0.1124, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 4.61, | |
| "grad_norm": 1.5898208618164062, | |
| "learning_rate": 3.187368421052632e-06, | |
| "loss": 0.1202, | |
| "step": 6975 | |
| }, | |
| { | |
| "epoch": 4.62, | |
| "grad_norm": 1.52357816696167, | |
| "learning_rate": 3.1610526315789474e-06, | |
| "loss": 0.1176, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 4.62, | |
| "eval_loss": 0.3240759074687958, | |
| "eval_runtime": 18.5252, | |
| "eval_samples_per_second": 91.281, | |
| "eval_steps_per_second": 0.756, | |
| "eval_wer": 24.116398151617336, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 4.64, | |
| "grad_norm": 1.4377552270889282, | |
| "learning_rate": 3.134736842105263e-06, | |
| "loss": 0.1189, | |
| "step": 7025 | |
| }, | |
| { | |
| "epoch": 4.66, | |
| "grad_norm": 1.679721713066101, | |
| "learning_rate": 3.1084210526315794e-06, | |
| "loss": 0.1165, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 4.67, | |
| "grad_norm": 1.7221696376800537, | |
| "learning_rate": 3.0821052631578952e-06, | |
| "loss": 0.1182, | |
| "step": 7075 | |
| }, | |
| { | |
| "epoch": 4.69, | |
| "grad_norm": 1.5595306158065796, | |
| "learning_rate": 3.055789473684211e-06, | |
| "loss": 0.1154, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 4.71, | |
| "grad_norm": 1.5186105966567993, | |
| "learning_rate": 3.0294736842105264e-06, | |
| "loss": 0.1167, | |
| "step": 7125 | |
| }, | |
| { | |
| "epoch": 4.72, | |
| "grad_norm": 1.6027384996414185, | |
| "learning_rate": 3.0031578947368423e-06, | |
| "loss": 0.1142, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 4.74, | |
| "grad_norm": 1.4588899612426758, | |
| "learning_rate": 2.976842105263158e-06, | |
| "loss": 0.1149, | |
| "step": 7175 | |
| }, | |
| { | |
| "epoch": 4.76, | |
| "grad_norm": 1.6083778142929077, | |
| "learning_rate": 2.9505263157894735e-06, | |
| "loss": 0.1152, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 4.77, | |
| "grad_norm": 1.3121345043182373, | |
| "learning_rate": 2.92421052631579e-06, | |
| "loss": 0.114, | |
| "step": 7225 | |
| }, | |
| { | |
| "epoch": 4.79, | |
| "grad_norm": 1.5029678344726562, | |
| "learning_rate": 2.8978947368421055e-06, | |
| "loss": 0.1175, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 4.81, | |
| "grad_norm": 1.5415253639221191, | |
| "learning_rate": 2.8715789473684214e-06, | |
| "loss": 0.1158, | |
| "step": 7275 | |
| }, | |
| { | |
| "epoch": 4.82, | |
| "grad_norm": 1.5756951570510864, | |
| "learning_rate": 2.845263157894737e-06, | |
| "loss": 0.1188, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 4.84, | |
| "grad_norm": 1.5500506162643433, | |
| "learning_rate": 2.8189473684210526e-06, | |
| "loss": 0.1138, | |
| "step": 7325 | |
| }, | |
| { | |
| "epoch": 4.85, | |
| "grad_norm": 1.4593719244003296, | |
| "learning_rate": 2.7926315789473684e-06, | |
| "loss": 0.1147, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 4.87, | |
| "grad_norm": 1.521674633026123, | |
| "learning_rate": 2.766315789473684e-06, | |
| "loss": 0.1166, | |
| "step": 7375 | |
| }, | |
| { | |
| "epoch": 4.89, | |
| "grad_norm": 1.594332218170166, | |
| "learning_rate": 2.7400000000000004e-06, | |
| "loss": 0.1156, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 4.9, | |
| "grad_norm": 1.5146125555038452, | |
| "learning_rate": 2.7136842105263163e-06, | |
| "loss": 0.1174, | |
| "step": 7425 | |
| }, | |
| { | |
| "epoch": 4.92, | |
| "grad_norm": 1.5220681428909302, | |
| "learning_rate": 2.6873684210526317e-06, | |
| "loss": 0.1151, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 4.94, | |
| "grad_norm": 1.5523508787155151, | |
| "learning_rate": 2.6610526315789475e-06, | |
| "loss": 0.1192, | |
| "step": 7475 | |
| }, | |
| { | |
| "epoch": 4.95, | |
| "grad_norm": 1.439876914024353, | |
| "learning_rate": 2.6347368421052633e-06, | |
| "loss": 0.1153, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 4.95, | |
| "eval_loss": 0.32601335644721985, | |
| "eval_runtime": 20.8661, | |
| "eval_samples_per_second": 81.041, | |
| "eval_steps_per_second": 0.671, | |
| "eval_wer": 23.960284750843012, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 4.97, | |
| "grad_norm": 1.5585688352584839, | |
| "learning_rate": 2.608421052631579e-06, | |
| "loss": 0.1204, | |
| "step": 7525 | |
| }, | |
| { | |
| "epoch": 4.99, | |
| "grad_norm": 1.5496189594268799, | |
| "learning_rate": 2.5821052631578954e-06, | |
| "loss": 0.1171, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 1.4494433403015137, | |
| "learning_rate": 2.5557894736842108e-06, | |
| "loss": 0.1143, | |
| "step": 7575 | |
| }, | |
| { | |
| "epoch": 5.02, | |
| "grad_norm": 1.5850895643234253, | |
| "learning_rate": 2.5294736842105266e-06, | |
| "loss": 0.1077, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 5.04, | |
| "grad_norm": 1.3688222169876099, | |
| "learning_rate": 2.5031578947368424e-06, | |
| "loss": 0.1095, | |
| "step": 7625 | |
| }, | |
| { | |
| "epoch": 5.05, | |
| "grad_norm": 1.4580186605453491, | |
| "learning_rate": 2.476842105263158e-06, | |
| "loss": 0.1111, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 5.07, | |
| "grad_norm": 1.3927934169769287, | |
| "learning_rate": 2.4505263157894736e-06, | |
| "loss": 0.1077, | |
| "step": 7675 | |
| }, | |
| { | |
| "epoch": 5.09, | |
| "grad_norm": 1.497953176498413, | |
| "learning_rate": 2.42421052631579e-06, | |
| "loss": 0.1105, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 5.1, | |
| "grad_norm": 1.5126893520355225, | |
| "learning_rate": 2.3978947368421052e-06, | |
| "loss": 0.1065, | |
| "step": 7725 | |
| }, | |
| { | |
| "epoch": 5.12, | |
| "grad_norm": 1.4988917112350464, | |
| "learning_rate": 2.371578947368421e-06, | |
| "loss": 0.1132, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 5.14, | |
| "grad_norm": 1.4799151420593262, | |
| "learning_rate": 2.3452631578947373e-06, | |
| "loss": 0.1078, | |
| "step": 7775 | |
| }, | |
| { | |
| "epoch": 5.15, | |
| "grad_norm": 1.4531598091125488, | |
| "learning_rate": 2.3189473684210527e-06, | |
| "loss": 0.1086, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 5.17, | |
| "grad_norm": 1.437127709388733, | |
| "learning_rate": 2.2926315789473685e-06, | |
| "loss": 0.1109, | |
| "step": 7825 | |
| }, | |
| { | |
| "epoch": 5.18, | |
| "grad_norm": 1.5070149898529053, | |
| "learning_rate": 2.2663157894736843e-06, | |
| "loss": 0.1086, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 5.2, | |
| "grad_norm": 1.4844095706939697, | |
| "learning_rate": 2.24e-06, | |
| "loss": 0.1103, | |
| "step": 7875 | |
| }, | |
| { | |
| "epoch": 5.22, | |
| "grad_norm": 1.5023523569107056, | |
| "learning_rate": 2.213684210526316e-06, | |
| "loss": 0.1103, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 5.23, | |
| "grad_norm": 1.4412981271743774, | |
| "learning_rate": 2.187368421052632e-06, | |
| "loss": 0.1084, | |
| "step": 7925 | |
| }, | |
| { | |
| "epoch": 5.25, | |
| "grad_norm": 1.438542127609253, | |
| "learning_rate": 2.1610526315789476e-06, | |
| "loss": 0.1091, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 5.27, | |
| "grad_norm": 1.4971038103103638, | |
| "learning_rate": 2.1347368421052634e-06, | |
| "loss": 0.1113, | |
| "step": 7975 | |
| }, | |
| { | |
| "epoch": 5.28, | |
| "grad_norm": 1.4342187643051147, | |
| "learning_rate": 2.1084210526315792e-06, | |
| "loss": 0.1093, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 5.28, | |
| "eval_loss": 0.32474491000175476, | |
| "eval_runtime": 18.2289, | |
| "eval_samples_per_second": 92.765, | |
| "eval_steps_per_second": 0.768, | |
| "eval_wer": 23.854127638316474, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 5.3, | |
| "grad_norm": 1.5157432556152344, | |
| "learning_rate": 2.082105263157895e-06, | |
| "loss": 0.11, | |
| "step": 8025 | |
| }, | |
| { | |
| "epoch": 5.32, | |
| "grad_norm": 1.5796202421188354, | |
| "learning_rate": 2.055789473684211e-06, | |
| "loss": 0.1101, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 5.33, | |
| "grad_norm": 1.3845866918563843, | |
| "learning_rate": 2.0294736842105263e-06, | |
| "loss": 0.1076, | |
| "step": 8075 | |
| }, | |
| { | |
| "epoch": 5.35, | |
| "grad_norm": 1.5526548624038696, | |
| "learning_rate": 2.003157894736842e-06, | |
| "loss": 0.1107, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 5.37, | |
| "grad_norm": 1.3970515727996826, | |
| "learning_rate": 1.976842105263158e-06, | |
| "loss": 0.1083, | |
| "step": 8125 | |
| }, | |
| { | |
| "epoch": 5.38, | |
| "grad_norm": 1.5313230752944946, | |
| "learning_rate": 1.9505263157894737e-06, | |
| "loss": 0.1096, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 5.4, | |
| "grad_norm": 1.4472230672836304, | |
| "learning_rate": 1.9242105263157896e-06, | |
| "loss": 0.1109, | |
| "step": 8175 | |
| }, | |
| { | |
| "epoch": 5.42, | |
| "grad_norm": 1.5823153257369995, | |
| "learning_rate": 1.8978947368421056e-06, | |
| "loss": 0.1094, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 5.43, | |
| "grad_norm": 1.5765074491500854, | |
| "learning_rate": 1.8715789473684212e-06, | |
| "loss": 0.1103, | |
| "step": 8225 | |
| }, | |
| { | |
| "epoch": 5.45, | |
| "grad_norm": 1.442234754562378, | |
| "learning_rate": 1.845263157894737e-06, | |
| "loss": 0.1084, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 5.47, | |
| "grad_norm": 1.40919828414917, | |
| "learning_rate": 1.8189473684210528e-06, | |
| "loss": 0.1068, | |
| "step": 8275 | |
| }, | |
| { | |
| "epoch": 5.48, | |
| "grad_norm": 1.5205286741256714, | |
| "learning_rate": 1.7926315789473686e-06, | |
| "loss": 0.1069, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 5.5, | |
| "grad_norm": 1.5483301877975464, | |
| "learning_rate": 1.7663157894736843e-06, | |
| "loss": 0.1123, | |
| "step": 8325 | |
| }, | |
| { | |
| "epoch": 5.52, | |
| "grad_norm": 1.5091420412063599, | |
| "learning_rate": 1.74e-06, | |
| "loss": 0.1071, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 5.53, | |
| "grad_norm": 1.4874048233032227, | |
| "learning_rate": 1.713684210526316e-06, | |
| "loss": 0.1113, | |
| "step": 8375 | |
| }, | |
| { | |
| "epoch": 5.55, | |
| "grad_norm": 1.3622137308120728, | |
| "learning_rate": 1.6873684210526317e-06, | |
| "loss": 0.1085, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 5.56, | |
| "grad_norm": 1.591680884361267, | |
| "learning_rate": 1.6610526315789473e-06, | |
| "loss": 0.1104, | |
| "step": 8425 | |
| }, | |
| { | |
| "epoch": 5.58, | |
| "grad_norm": 1.479125738143921, | |
| "learning_rate": 1.6347368421052633e-06, | |
| "loss": 0.1097, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 5.6, | |
| "grad_norm": 1.5606906414031982, | |
| "learning_rate": 1.6084210526315792e-06, | |
| "loss": 0.1082, | |
| "step": 8475 | |
| }, | |
| { | |
| "epoch": 5.61, | |
| "grad_norm": 1.5121188163757324, | |
| "learning_rate": 1.5821052631578948e-06, | |
| "loss": 0.1129, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 5.61, | |
| "eval_loss": 0.3241681754589081, | |
| "eval_runtime": 17.5037, | |
| "eval_samples_per_second": 96.608, | |
| "eval_steps_per_second": 0.8, | |
| "eval_wer": 22.848757337329836, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 5.63, | |
| "grad_norm": 1.3083462715148926, | |
| "learning_rate": 1.5557894736842106e-06, | |
| "loss": 0.1073, | |
| "step": 8525 | |
| }, | |
| { | |
| "epoch": 5.65, | |
| "grad_norm": 1.4445217847824097, | |
| "learning_rate": 1.5294736842105264e-06, | |
| "loss": 0.108, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 5.66, | |
| "grad_norm": 1.4660565853118896, | |
| "learning_rate": 1.5031578947368422e-06, | |
| "loss": 0.1087, | |
| "step": 8575 | |
| }, | |
| { | |
| "epoch": 5.68, | |
| "grad_norm": 1.5583314895629883, | |
| "learning_rate": 1.4768421052631578e-06, | |
| "loss": 0.1044, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 5.7, | |
| "grad_norm": 1.4255391359329224, | |
| "learning_rate": 1.4505263157894739e-06, | |
| "loss": 0.1071, | |
| "step": 8625 | |
| }, | |
| { | |
| "epoch": 5.71, | |
| "grad_norm": 1.5511982440948486, | |
| "learning_rate": 1.4242105263157897e-06, | |
| "loss": 0.108, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 5.73, | |
| "grad_norm": 1.5022433996200562, | |
| "learning_rate": 1.3978947368421053e-06, | |
| "loss": 0.1092, | |
| "step": 8675 | |
| }, | |
| { | |
| "epoch": 5.75, | |
| "grad_norm": 1.5003283023834229, | |
| "learning_rate": 1.3715789473684213e-06, | |
| "loss": 0.1066, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 5.76, | |
| "grad_norm": 1.5088740587234497, | |
| "learning_rate": 1.345263157894737e-06, | |
| "loss": 0.1055, | |
| "step": 8725 | |
| }, | |
| { | |
| "epoch": 5.78, | |
| "grad_norm": 1.563700556755066, | |
| "learning_rate": 1.3189473684210527e-06, | |
| "loss": 0.1069, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 5.8, | |
| "grad_norm": 1.4417468309402466, | |
| "learning_rate": 1.2926315789473683e-06, | |
| "loss": 0.1061, | |
| "step": 8775 | |
| }, | |
| { | |
| "epoch": 5.81, | |
| "grad_norm": 1.412596583366394, | |
| "learning_rate": 1.2663157894736844e-06, | |
| "loss": 0.1095, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 5.83, | |
| "grad_norm": 1.4061535596847534, | |
| "learning_rate": 1.2400000000000002e-06, | |
| "loss": 0.1099, | |
| "step": 8825 | |
| }, | |
| { | |
| "epoch": 5.85, | |
| "grad_norm": 1.4590774774551392, | |
| "learning_rate": 1.213684210526316e-06, | |
| "loss": 0.1089, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 5.86, | |
| "grad_norm": 1.417046070098877, | |
| "learning_rate": 1.1873684210526316e-06, | |
| "loss": 0.1097, | |
| "step": 8875 | |
| }, | |
| { | |
| "epoch": 5.88, | |
| "grad_norm": 1.5805013179779053, | |
| "learning_rate": 1.1610526315789474e-06, | |
| "loss": 0.1122, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 5.89, | |
| "grad_norm": 1.562596321105957, | |
| "learning_rate": 1.1347368421052633e-06, | |
| "loss": 0.1085, | |
| "step": 8925 | |
| }, | |
| { | |
| "epoch": 5.91, | |
| "grad_norm": 1.5319128036499023, | |
| "learning_rate": 1.108421052631579e-06, | |
| "loss": 0.112, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 5.93, | |
| "grad_norm": 1.468923568725586, | |
| "learning_rate": 1.082105263157895e-06, | |
| "loss": 0.1098, | |
| "step": 8975 | |
| }, | |
| { | |
| "epoch": 5.94, | |
| "grad_norm": 1.4811102151870728, | |
| "learning_rate": 1.0557894736842105e-06, | |
| "loss": 0.1069, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 5.94, | |
| "eval_loss": 0.3231496810913086, | |
| "eval_runtime": 16.5945, | |
| "eval_samples_per_second": 101.901, | |
| "eval_steps_per_second": 0.844, | |
| "eval_wer": 22.41163981516173, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 5.96, | |
| "grad_norm": 1.4732502698898315, | |
| "learning_rate": 1.0294736842105265e-06, | |
| "loss": 0.1115, | |
| "step": 9025 | |
| }, | |
| { | |
| "epoch": 5.98, | |
| "grad_norm": 1.5112581253051758, | |
| "learning_rate": 1.0031578947368421e-06, | |
| "loss": 0.1067, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 5.99, | |
| "grad_norm": 1.4593307971954346, | |
| "learning_rate": 9.76842105263158e-07, | |
| "loss": 0.1092, | |
| "step": 9075 | |
| }, | |
| { | |
| "epoch": 6.01, | |
| "grad_norm": 1.3361061811447144, | |
| "learning_rate": 9.505263157894738e-07, | |
| "loss": 0.1077, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 6.03, | |
| "grad_norm": 1.5821435451507568, | |
| "learning_rate": 9.242105263157895e-07, | |
| "loss": 0.1023, | |
| "step": 9125 | |
| }, | |
| { | |
| "epoch": 6.04, | |
| "grad_norm": 1.3687916994094849, | |
| "learning_rate": 8.978947368421054e-07, | |
| "loss": 0.1012, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 6.06, | |
| "grad_norm": 1.5094650983810425, | |
| "learning_rate": 8.715789473684211e-07, | |
| "loss": 0.1, | |
| "step": 9175 | |
| }, | |
| { | |
| "epoch": 6.08, | |
| "grad_norm": 1.3472874164581299, | |
| "learning_rate": 8.452631578947369e-07, | |
| "loss": 0.1047, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 6.09, | |
| "grad_norm": 1.446553111076355, | |
| "learning_rate": 8.189473684210527e-07, | |
| "loss": 0.1041, | |
| "step": 9225 | |
| }, | |
| { | |
| "epoch": 6.11, | |
| "grad_norm": 1.5492606163024902, | |
| "learning_rate": 7.926315789473685e-07, | |
| "loss": 0.1081, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 6.13, | |
| "grad_norm": 1.4887338876724243, | |
| "learning_rate": 7.663157894736843e-07, | |
| "loss": 0.1071, | |
| "step": 9275 | |
| }, | |
| { | |
| "epoch": 6.14, | |
| "grad_norm": 1.290645718574524, | |
| "learning_rate": 7.4e-07, | |
| "loss": 0.1025, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 6.16, | |
| "grad_norm": 1.4855327606201172, | |
| "learning_rate": 7.136842105263158e-07, | |
| "loss": 0.1032, | |
| "step": 9325 | |
| }, | |
| { | |
| "epoch": 6.18, | |
| "grad_norm": 1.4177087545394897, | |
| "learning_rate": 6.873684210526315e-07, | |
| "loss": 0.105, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 6.19, | |
| "grad_norm": 1.3693170547485352, | |
| "learning_rate": 6.610526315789475e-07, | |
| "loss": 0.1064, | |
| "step": 9375 | |
| }, | |
| { | |
| "epoch": 6.21, | |
| "grad_norm": 1.5773143768310547, | |
| "learning_rate": 6.347368421052633e-07, | |
| "loss": 0.1036, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 6.23, | |
| "grad_norm": 1.4657046794891357, | |
| "learning_rate": 6.08421052631579e-07, | |
| "loss": 0.1046, | |
| "step": 9425 | |
| }, | |
| { | |
| "epoch": 6.24, | |
| "grad_norm": 1.4977328777313232, | |
| "learning_rate": 5.821052631578948e-07, | |
| "loss": 0.1021, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 6.26, | |
| "grad_norm": 1.3914306163787842, | |
| "learning_rate": 5.557894736842106e-07, | |
| "loss": 0.0998, | |
| "step": 9475 | |
| }, | |
| { | |
| "epoch": 6.27, | |
| "grad_norm": 1.487586498260498, | |
| "learning_rate": 5.294736842105263e-07, | |
| "loss": 0.1029, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 6.27, | |
| "eval_loss": 0.3232876658439636, | |
| "eval_runtime": 16.4967, | |
| "eval_samples_per_second": 102.505, | |
| "eval_steps_per_second": 0.849, | |
| "eval_wer": 22.567753215936058, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 6.29, | |
| "grad_norm": 1.5918724536895752, | |
| "learning_rate": 5.031578947368422e-07, | |
| "loss": 0.1054, | |
| "step": 9525 | |
| }, | |
| { | |
| "epoch": 6.31, | |
| "grad_norm": 1.422078251838684, | |
| "learning_rate": 4.768421052631579e-07, | |
| "loss": 0.1055, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 6.32, | |
| "grad_norm": 1.4294945001602173, | |
| "learning_rate": 4.505263157894737e-07, | |
| "loss": 0.1043, | |
| "step": 9575 | |
| }, | |
| { | |
| "epoch": 6.34, | |
| "grad_norm": 1.469376802444458, | |
| "learning_rate": 4.242105263157895e-07, | |
| "loss": 0.1032, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 6.36, | |
| "grad_norm": 1.555346965789795, | |
| "learning_rate": 3.9789473684210533e-07, | |
| "loss": 0.1055, | |
| "step": 9625 | |
| }, | |
| { | |
| "epoch": 6.37, | |
| "grad_norm": 1.4565141201019287, | |
| "learning_rate": 3.715789473684211e-07, | |
| "loss": 0.1079, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 6.39, | |
| "grad_norm": 1.4277021884918213, | |
| "learning_rate": 3.4526315789473686e-07, | |
| "loss": 0.1034, | |
| "step": 9675 | |
| }, | |
| { | |
| "epoch": 6.41, | |
| "grad_norm": 1.5641932487487793, | |
| "learning_rate": 3.1894736842105263e-07, | |
| "loss": 0.1065, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 6.42, | |
| "grad_norm": 1.4544775485992432, | |
| "learning_rate": 2.9263157894736845e-07, | |
| "loss": 0.1026, | |
| "step": 9725 | |
| }, | |
| { | |
| "epoch": 6.44, | |
| "grad_norm": 1.44139564037323, | |
| "learning_rate": 2.663157894736842e-07, | |
| "loss": 0.1059, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 6.46, | |
| "grad_norm": 1.3898285627365112, | |
| "learning_rate": 2.4000000000000003e-07, | |
| "loss": 0.104, | |
| "step": 9775 | |
| }, | |
| { | |
| "epoch": 6.47, | |
| "grad_norm": 1.4317445755004883, | |
| "learning_rate": 2.136842105263158e-07, | |
| "loss": 0.1051, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 6.49, | |
| "grad_norm": 1.672619342803955, | |
| "learning_rate": 1.8736842105263162e-07, | |
| "loss": 0.1057, | |
| "step": 9825 | |
| }, | |
| { | |
| "epoch": 6.51, | |
| "grad_norm": 1.528280258178711, | |
| "learning_rate": 1.6105263157894738e-07, | |
| "loss": 0.1048, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 6.52, | |
| "grad_norm": 1.4008196592330933, | |
| "learning_rate": 1.3473684210526317e-07, | |
| "loss": 0.1048, | |
| "step": 9875 | |
| }, | |
| { | |
| "epoch": 6.54, | |
| "grad_norm": 1.4791390895843506, | |
| "learning_rate": 1.0842105263157895e-07, | |
| "loss": 0.1039, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 6.56, | |
| "grad_norm": 1.4586882591247559, | |
| "learning_rate": 8.210526315789474e-08, | |
| "loss": 0.1057, | |
| "step": 9925 | |
| }, | |
| { | |
| "epoch": 6.57, | |
| "grad_norm": 1.4133316278457642, | |
| "learning_rate": 5.578947368421053e-08, | |
| "loss": 0.106, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 6.59, | |
| "grad_norm": 1.4374464750289917, | |
| "learning_rate": 2.9473684210526318e-08, | |
| "loss": 0.1055, | |
| "step": 9975 | |
| }, | |
| { | |
| "epoch": 6.61, | |
| "grad_norm": 1.4011142253875732, | |
| "learning_rate": 3.1578947368421054e-09, | |
| "loss": 0.1056, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 6.61, | |
| "eval_loss": 0.3232288956642151, | |
| "eval_runtime": 15.5989, | |
| "eval_samples_per_second": 108.405, | |
| "eval_steps_per_second": 0.897, | |
| "eval_wer": 22.42412888722368, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 6.61, | |
| "step": 10000, | |
| "total_flos": 6.300100720410624e+19, | |
| "train_loss": 0.2321115765094757, | |
| "train_runtime": 12814.2682, | |
| "train_samples_per_second": 199.777, | |
| "train_steps_per_second": 0.78 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 10000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 7, | |
| "save_steps": 1000, | |
| "total_flos": 6.300100720410624e+19, | |
| "train_batch_size": 256, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |