| { | |
| "base_model": "DedeProGames/DynamicMind-Mini", | |
| "dataset": "HuggingFaceTB/smol-smoltalk", | |
| "dataset_config": "default", | |
| "dataset_split": "train", | |
| "training_type": "full_parameter_supervised_finetuning", | |
| "loss_mask": "assistant_content_and_eos_only", | |
| "global_step": 3440, | |
| "tokens_seen": 507248640, | |
| "supervised_tokens_seen": 361226420, | |
| "sequence_length": 1024, | |
| "effective_batch_sequences": 144, | |
| "tokens_per_step": 147456, | |
| "peak_learning_rate": 0.0002, | |
| "warmup_steps": 100, | |
| "lr_schedule": "constant_after_warmup", | |
| "optimizer": "AdamW", | |
| "betas": [ | |
| 0.9, | |
| 0.95 | |
| ], | |
| "weight_decay": 0.1, | |
| "grad_clip": 1.0, | |
| "seed": 1337, | |
| "final_loss": 1.917157530784607, | |
| "recipe_source": "BananaMind/BananaMind-2-Nano-Chat (adapted to 1024-token context)" | |
| } |