learning_rate: 2.0e-4 num_train_epochs: 1 max_seq_length: 8192 per_device_train_batch_size: 2 gradient_accumulation_steps: 4 optim: "adamw_8bit" bf16: true save_strategy: "epoch"