File size: 3,380 Bytes
ba6f865 9e82e7c ba6f865 9e82e7c ba6f865 9e82e7c | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 | model:
n_layer: 2
d_model: 3072
n_ctx: 512
d_head: 16
d_mlp: 12288
vocab_size: 4096
use_rms_norm: true
tie_embeddings: false
use_positional_embeddings: false
use_bigram_table: false
use_attention_sinks: true
activation: gelu
dropout: 0
use_bias: true
use_flash_attention: true
gradient_checkpointing: false
sparsity:
enable_weight_sparsity: true
target_l0_fraction: 0.01
sparsity_anneal_start_fraction: 0.5
sparsity_anneal_end_fraction: 0.75
anneal_type: linear
min_weights_per_neuron: 4
enable_activation_sparsity: true
activation_topk_fraction: 0.2
activation_sparsity_locations: attn_q,attn_k,attn_v,attn_out,mlp_neuron,mlp_out
activation_topk_mode: per_token
mlp_neuron_pre_activation: true
activation_topk_annealing: linear
activation_topk_anneal_start_fraction: 0.01
activation_topk_anneal_end_fraction: 0.33
optimizer:
optimizer_type: adamw
learning_rate: 0.001
beta1: 0.9
beta2: 0.95
weight_decay: 0.001
eps: 0.1
enable_grad_clip: true
grad_clip_rms: 1
warmup_fraction: 0.01
enable_lr_decay: true
min_lr_fraction: 0
lr_decay_start_fraction: 0.8
lr_decay_end_fraction: 1
use_sharkfin_schedule: true
training:
dataset_name: jacobcd52/simplestories-tokenized
dataset_split: train
text_column: story
tokenizer_name: SimpleStories/SimpleStories-1.25M
total_tokens: 1000000000
batch_size: 32
gradient_accumulation_steps: 1
mixed_precision: bf16
checkpoint_dir: checkpoints/ablation_pretraining/separate_normalization
checkpoint_every_n_steps: 0
keep_n_checkpoints: 0
log_every_n_steps: 10
log_gradients_every_n_steps: 100
log_weights_every_n_steps: 100
log_sparsity_every_n_steps: 100
eval_every_n_steps: 100
val_split: test
val_holdout_fraction: 0.01
val_max_batches: 20
wandb_project: nodesparse_adv_pretraining
wandb_run_name: separate_normalization
wandb_entity: null
use_wandb: true
seed: 0
hf_repo: asher577/separate_normalization
num_workers: 2
resume_from_checkpoint: null
use_torch_compile: false
torch_compile_mode: default
torch_compile_backend: inductor
ablation:
ci_fn_type: global_reverse_residual
d_resid_ci_fn: 1024
reader_hidden_dims: 1024,1024
use_attn_transitions: false
attn_n_heads: 4
attn_max_len: 2048
ci_targets: attn_q,attn_k,attn_v,attn_out,mlp_pre,mlp_out
pgd_loss_frac: 0.5
stochastic_loss_frac: 0.16
ci_loss_frac: 0.17
unmasked_loss_frac: 0.17
adv_kl_coeff: 0.5
pgd_init: random
pgd_lr: 0.4
pgd_n_steps: 1
pgd_use_sign_grad: true
pgd_outer_lr: 0
pgd_mode: batch
separate_grad_normalize: true
separate_grad_min_frac: 0.25
minimality_coeff: 6.0e-08
minimality_coeff_final_frac: 1
minimality_coeff_annealing: true
minimality_coeff_anneal_start_frac: 0.25
minimality_coeff_anneal_end_frac: 0.5
minimality_coeff_anneal_type: exp
minimality_pnorm: 2
minimality_eps: 1.0e-12
minimality_beta: 325
minimality_p_anneal_start_frac: 0.02
minimality_p_anneal_final_p: 0.4
minimality_p_anneal_end_frac: 0.95
minimality_beta_pnorm: 2
minimality_beta_p_anneal_start_frac: 0.02
minimality_beta_p_anneal_final_p: 0.4
minimality_beta_p_anneal_end_frac: 0.95
initial_ci: 1
minimality_warmup_frac: 0.02
ci_thresholding: 0
binarization_coeff: 0
binarization_anneal_start_frac: 0.8
binarization_anneal_end_frac: 1
ci_learning_rate: 0.001
|