asher577 commited on
Commit
45efee0
·
verified ·
1 Parent(s): 9782e98

Upload training_config.yaml with huggingface_hub

Browse files
Files changed (1) hide show
  1. training_config.yaml +106 -0
training_config.yaml ADDED
@@ -0,0 +1,106 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ model:
2
+ n_layer: 2
3
+ d_model: 3072
4
+ n_ctx: 512
5
+ d_head: 16
6
+ d_mlp: 12288
7
+ vocab_size: 4096
8
+ use_rms_norm: true
9
+ tie_embeddings: false
10
+ use_positional_embeddings: false
11
+ use_bigram_table: false
12
+ use_attention_sinks: true
13
+ activation: gelu
14
+ dropout: 0.0
15
+ use_bias: true
16
+ use_flash_attention: true
17
+ sparsity:
18
+ enable_weight_sparsity: true
19
+ target_l0_fraction: 0.005
20
+ sparsity_anneal_start_fraction: 0.01
21
+ sparsity_anneal_end_fraction: 0.5
22
+ anneal_type: linear
23
+ min_weights_per_neuron: 4
24
+ enable_activation_sparsity: true
25
+ activation_topk_fraction: 0.5
26
+ activation_sparsity_locations: attn_q,attn_k,attn_v,attn_out,mlp_neuron,mlp_out
27
+ activation_topk_mode: batch
28
+ mlp_neuron_pre_activation: true
29
+ activation_topk_annealing: linear
30
+ activation_topk_anneal_start_fraction: 0.01
31
+ activation_topk_anneal_end_fraction: 0.5
32
+ optimizer:
33
+ optimizer_type: adamw
34
+ learning_rate: 0.001
35
+ beta1: 0.9
36
+ beta2: 0.95
37
+ weight_decay: 0.001
38
+ eps: 0.1
39
+ enable_grad_clip: true
40
+ grad_clip_rms: 1.0
41
+ warmup_fraction: 0.01
42
+ enable_lr_decay: true
43
+ min_lr_fraction: 0.0
44
+ lr_decay_end_fraction: 1.0
45
+ use_sharkfin_schedule: true
46
+ training:
47
+ dataset_name: jacobcd52/simplestories-tokenized
48
+ dataset_split: train
49
+ text_column: story
50
+ tokenizer_name: SimpleStories/SimpleStories-1.25M
51
+ total_tokens: 1000000000
52
+ batch_size: 32
53
+ gradient_accumulation_steps: 1
54
+ mixed_precision: bf16
55
+ checkpoint_dir: checkpoints/ablation_pretraining/pgd_d3072
56
+ checkpoint_every_n_steps: 0
57
+ keep_n_checkpoints: 2
58
+ log_every_n_steps: 10
59
+ log_gradients_every_n_steps: 100
60
+ log_weights_every_n_steps: 100
61
+ log_sparsity_every_n_steps: 100
62
+ eval_every_n_steps: 100
63
+ val_split: test
64
+ val_holdout_fraction: 0.01
65
+ val_max_batches: 20
66
+ wandb_project: nodesparse_adv_pretraining
67
+ wandb_run_name: less_topk
68
+ wandb_entity: null
69
+ use_wandb: true
70
+ seed: 0
71
+ hf_repo: asher577/less_topk
72
+ num_workers: 8
73
+ resume_from_checkpoint: null
74
+ use_torch_compile: false
75
+ torch_compile_mode: default
76
+ torch_compile_backend: inductor
77
+ ablation:
78
+ ci_fn_type: global_reverse_residual
79
+ d_resid_ci_fn: 1024
80
+ reader_hidden_dims: 1024,1024
81
+ use_attn_transitions: false
82
+ attn_n_heads: 4
83
+ attn_max_len: 2048
84
+ ci_targets: attn_q,attn_k,attn_v,attn_out,mlp_pre,mlp_out
85
+ ablation_mode: pgd
86
+ stochastic_n_bins: 10
87
+ pgd_init: random
88
+ pgd_lr: 0.2
89
+ pgd_n_steps: 2
90
+ pgd_use_sign_grad: true
91
+ pgd_outer_lr: 0.0
92
+ minimality_coeff: 8.0e-06
93
+ minimality_coeff_final_frac: 1.0
94
+ minimality_coeff_annealing: true
95
+ minimality_coeff_anneal_start_frac: 0.01
96
+ minimality_coeff_anneal_end_frac: 0.7
97
+ minimality_coeff_anneal_type: linear
98
+ minimality_pnorm: 2.0
99
+ minimality_eps: 5.0e-07
100
+ minimality_beta: 0.6
101
+ minimality_p_anneal_start_frac: 0.01
102
+ minimality_p_anneal_final_p: 0.5
103
+ minimality_p_anneal_end_frac: 0.5
104
+ initial_ci: 1.0
105
+ minimality_warmup_frac: 0.02
106
+ ci_learning_rate: null