| # TinyGSM Dataset Configuration | |
| # Math reasoning dataset for language model training | |
| defaults: | |
| - _base | |
| - _self_ | |
| # Dataset Identity | |
| dataset_name: tinygsm | |
| init_fn: lmr.data.tinygsm.initialize_dataset | |
| # Token Limits | |
| max_tokens_train: None # 50M tokens for training | |
| max_tokens_validation: None # 500K tokens for validation | |
| max_tokens_test: None # 500K tokens for test | |
| tokens_buffer: 10k # Additional tokens buffer to prevent inconsistencies | |
| # TinyGSM has single component (math problems) | |
| sampling_type: single # Not proportional, single component | |
| component_name: tinygsm | |
| # HuggingFace dataset path | |
| hf_dataset_path: "TinyGSM/TinyGSM" # or your TinyGSM dataset path | |
| training: | |
| resume_checkpoint_path: /work/jf381/for_jay/best_epoch_000_step_000151000_tokens_130b_val.pt |