{ "base_model": "CohereLabs/cohere-transcribe-arabic-07-2026", "variant": "middle", "method": "decoder_only_finetune", "target_column": "english", "dataset": "Ahmed1/cohere-asr-cs", "effective_batch_size": 32, "seed": 42, "bf16": true, "train_examples": 1900, "val_examples": 454, "metrics": { "train_runtime": 408.5423, "train_samples_per_second": 27.904, "train_steps_per_second": 0.881, "total_flos": 5.372639220298678e+19, "train_loss": 0.14237111575073666, "epoch": 6.0 }, "freeze": { "variant": "middle", "decoder_module": "model.decoder", "decoder_layers_total": 8, "decoder_layers_trained": [ 3, 4 ], "train_decoder_io": true, "output_head": "proj_out", "io_trainable_params": 35935232, "layer_trainable_params": 33593344, "encoder_module": "model.encoder", "encoder_trainable_params": 0, "total_params": 2065647872, "trainable_params": 69528576, "trainable_pct": 3.366 }, "hyperparameters": { "learning_rate": 8e-05, "num_train_epochs": 6, "lr_scheduler_type": "cosine", "warmup_ratio": 0.03, "per_device_train_batch_size": 16, "gradient_accumulation_steps": 2, "optim": "adamw_bnb_8bit", "weight_decay": 0.01, "max_grad_norm": 1.0, "save_total_limit": 1 } }