cohere-cs-decoder-full / train_meta.json
nsa01n's picture
decoder-only fine-tune (full)
aec1bb1 verified
Raw History Blame Contribute Delete
1.38 kB
{
"base_model": "CohereLabs/cohere-transcribe-arabic-07-2026",
"variant": "full",
"method": "decoder_only_finetune",
"target_column": "english",
"dataset": "Ahmed1/cohere-asr-cs",
"effective_batch_size": 32,
"seed": 42,
"bf16": true,
"train_examples": 1900,
"val_examples": 454,
"metrics": {
"train_runtime": 419.5181,
"train_samples_per_second": 27.174,
"train_steps_per_second": 0.858,
"total_flos": 5.372639220298678e+19,
"train_loss": 0.10716057336992688,
"epoch": 6.0
},
"freeze": {
"variant": "full",
"decoder_module": "model.decoder",
"decoder_layers_total": 8,
"decoder_layers_trained": [
0,
1,
2,
3,
4,
5,
6,
7
],
"train_decoder_io": true,
"output_head": "proj_out",
"io_trainable_params": 35935232,
"layer_trainable_params": 134373376,
"encoder_module": "model.encoder",
"encoder_trainable_params": 0,
"total_params": 2065647872,
"trainable_params": 170308608,
"trainable_pct": 8.245
},
"hyperparameters": {
"learning_rate": 8e-05,
"num_train_epochs": 6,
"lr_scheduler_type": "cosine",
"warmup_ratio": 0.03,
"per_device_train_batch_size": 16,
"gradient_accumulation_steps": 2,
"optim": "adamw_bnb_8bit",
"weight_decay": 0.01,
"max_grad_norm": 1.0,
"save_total_limit": 1
}
}