ci_thresholding / training_config.yaml
asher577's picture
Upload training_config.yaml with huggingface_hub
8225c13 verified
Raw
History Blame Contribute Delete
2.91 kB
model:
n_layer: 2
d_model: 3072
n_ctx: 512
d_head: 16
d_mlp: 12288
vocab_size: 4096
use_rms_norm: true
tie_embeddings: false
use_positional_embeddings: false
use_bigram_table: false
use_attention_sinks: true
activation: gelu
dropout: 0.0
use_bias: true
use_flash_attention: true
sparsity:
enable_weight_sparsity: true
target_l0_fraction: 0.05
sparsity_anneal_start_fraction: 0.01
sparsity_anneal_end_fraction: 0.5
anneal_type: linear
min_weights_per_neuron: 4
enable_activation_sparsity: true
activation_topk_fraction: 0.2
activation_sparsity_locations: attn_q,attn_k,attn_v,attn_out,mlp_neuron,mlp_out
activation_topk_mode: per_token
mlp_neuron_pre_activation: true
activation_topk_annealing: linear
activation_topk_anneal_start_fraction: 0.01
activation_topk_anneal_end_fraction: 0.5
optimizer:
optimizer_type: adamw
learning_rate: 0.001
beta1: 0.9
beta2: 0.95
weight_decay: 0.001
eps: 0.1
enable_grad_clip: true
grad_clip_rms: 1.0
warmup_fraction: 0.01
enable_lr_decay: true
min_lr_fraction: 0.0
lr_decay_end_fraction: 1.0
use_sharkfin_schedule: true
training:
dataset_name: jacobcd52/simplestories-tokenized
dataset_split: train
text_column: story
tokenizer_name: SimpleStories/SimpleStories-1.25M
total_tokens: 1000000000
batch_size: 32
gradient_accumulation_steps: 1
mixed_precision: bf16
checkpoint_dir: checkpoints/ablation_pretraining/pgd_d3072
checkpoint_every_n_steps: 0
keep_n_checkpoints: 0
log_every_n_steps: 10
log_gradients_every_n_steps: 100
log_weights_every_n_steps: 100
log_sparsity_every_n_steps: 100
eval_every_n_steps: 100
val_split: test
val_holdout_fraction: 0.01
val_max_batches: 20
wandb_project: nodesparse_adv_pretraining
wandb_run_name: ci_thresholding_l0_0.05
wandb_entity: null
use_wandb: true
seed: 0
hf_repo: asher577/ci_thresholding
num_workers: 8
resume_from_checkpoint: null
use_torch_compile: false
torch_compile_mode: default
torch_compile_backend: inductor
ablation:
ci_fn_type: global_reverse_residual
d_resid_ci_fn: 1024
reader_hidden_dims: 1024,1024
use_attn_transitions: false
attn_n_heads: 4
attn_max_len: 2048
ci_targets: attn_q,attn_k,attn_v,attn_out,mlp_pre,mlp_out
ablation_mode: pgd
stochastic_n_bins: 10
pgd_init: random
pgd_lr: 0.2
pgd_n_steps: 2
pgd_use_sign_grad: true
pgd_outer_lr: 0.0
minimality_coeff: 1.0e-05
minimality_coeff_final_frac: 1.0
minimality_coeff_annealing: true
minimality_coeff_anneal_start_frac: 0.01
minimality_coeff_anneal_end_frac: 0.7
minimality_coeff_anneal_type: linear
minimality_pnorm: 2.0
minimality_eps: 5.0e-07
minimality_beta: 0.5
minimality_p_anneal_start_frac: 0.01
minimality_p_anneal_final_p: 0.5
minimality_p_anneal_end_frac: 0.5
initial_ci: 1.0
minimality_warmup_frac: 0.02
ci_thresholding: 0.1
ci_learning_rate: null