{ "base_model": "CohereLabs/cohere-transcribe-arabic-07-2026", "variant": "full", "method": "decoder_only_finetune", "target_column": "english", "dataset": "Ahmed1/cohere-asr-cs", "effective_batch_size": 32, "seed": 42, "bf16": true, "train_examples": 1900, "val_examples": 454, "metrics": { "train_runtime": 419.5181, "train_samples_per_second": 27.174, "train_steps_per_second": 0.858, "total_flos": 5.372639220298678e+19, "train_loss": 0.10716057336992688, "epoch": 6.0 }, "freeze": { "variant": "full", "decoder_module": "model.decoder", "decoder_layers_total": 8, "decoder_layers_trained": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "train_decoder_io": true, "output_head": "proj_out", "io_trainable_params": 35935232, "layer_trainable_params": 134373376, "encoder_module": "model.encoder", "encoder_trainable_params": 0, "total_params": 2065647872, "trainable_params": 170308608, "trainable_pct": 8.245 }, "hyperparameters": { "learning_rate": 8e-05, "num_train_epochs": 6, "lr_scheduler_type": "cosine", "warmup_ratio": 0.03, "per_device_train_batch_size": 16, "gradient_accumulation_steps": 2, "optim": "adamw_bnb_8bit", "weight_decay": 0.01, "max_grad_norm": 1.0, "save_total_limit": 1 } }