| learning_rate: 2.0e-4 | |
| num_train_epochs: 1 | |
| max_seq_length: 8192 | |
| per_device_train_batch_size: 2 | |
| gradient_accumulation_steps: 4 | |
| optim: "adamw_8bit" | |
| bf16: true | |
| save_strategy: "epoch" | |
| learning_rate: 2.0e-4 | |
| num_train_epochs: 1 | |
| max_seq_length: 8192 | |
| per_device_train_batch_size: 2 | |
| gradient_accumulation_steps: 4 | |
| optim: "adamw_8bit" | |
| bf16: true | |
| save_strategy: "epoch" | |