cohere-cs-decoder-middle / train_meta.json
nsa01n's picture
decoder-only fine-tune (middle)
602af72 verified
Raw History Blame Contribute Delete
1.33 kB
{
"base_model": "CohereLabs/cohere-transcribe-arabic-07-2026",
"variant": "middle",
"method": "decoder_only_finetune",
"target_column": "english",
"dataset": "Ahmed1/cohere-asr-cs",
"effective_batch_size": 32,
"seed": 42,
"bf16": true,
"train_examples": 1900,
"val_examples": 454,
"metrics": {
"train_runtime": 408.5423,
"train_samples_per_second": 27.904,
"train_steps_per_second": 0.881,
"total_flos": 5.372639220298678e+19,
"train_loss": 0.14237111575073666,
"epoch": 6.0
},
"freeze": {
"variant": "middle",
"decoder_module": "model.decoder",
"decoder_layers_total": 8,
"decoder_layers_trained": [
3,
4
],
"train_decoder_io": true,
"output_head": "proj_out",
"io_trainable_params": 35935232,
"layer_trainable_params": 33593344,
"encoder_module": "model.encoder",
"encoder_trainable_params": 0,
"total_params": 2065647872,
"trainable_params": 69528576,
"trainable_pct": 3.366
},
"hyperparameters": {
"learning_rate": 8e-05,
"num_train_epochs": 6,
"lr_scheduler_type": "cosine",
"warmup_ratio": 0.03,
"per_device_train_batch_size": 16,
"gradient_accumulation_steps": 2,
"optim": "adamw_bnb_8bit",
"weight_decay": 0.01,
"max_grad_norm": 1.0,
"save_total_limit": 1
}
}