model: n_layer: 2 d_model: 3072 n_ctx: 512 d_head: 16 d_mlp: 12288 vocab_size: 4096 use_rms_norm: true tie_embeddings: false use_positional_embeddings: false use_bigram_table: false use_attention_sinks: true activation: gelu dropout: 0.0 use_bias: true use_flash_attention: true sparsity: enable_weight_sparsity: true target_l0_fraction: 0.05 sparsity_anneal_start_fraction: 0.01 sparsity_anneal_end_fraction: 0.5 anneal_type: linear min_weights_per_neuron: 4 enable_activation_sparsity: true activation_topk_fraction: 0.2 activation_sparsity_locations: attn_q,attn_k,attn_v,attn_out,mlp_neuron,mlp_out activation_topk_mode: per_token mlp_neuron_pre_activation: true activation_topk_annealing: linear activation_topk_anneal_start_fraction: 0.01 activation_topk_anneal_end_fraction: 0.5 optimizer: optimizer_type: adamw learning_rate: 0.001 beta1: 0.9 beta2: 0.95 weight_decay: 0.001 eps: 0.1 enable_grad_clip: true grad_clip_rms: 1.0 warmup_fraction: 0.01 enable_lr_decay: true min_lr_fraction: 0.0 lr_decay_end_fraction: 1.0 use_sharkfin_schedule: true training: dataset_name: jacobcd52/simplestories-tokenized dataset_split: train text_column: story tokenizer_name: SimpleStories/SimpleStories-1.25M total_tokens: 1000000000 batch_size: 32 gradient_accumulation_steps: 1 mixed_precision: bf16 checkpoint_dir: checkpoints/ablation_pretraining/pgd_d3072 checkpoint_every_n_steps: 0 keep_n_checkpoints: 0 log_every_n_steps: 10 log_gradients_every_n_steps: 100 log_weights_every_n_steps: 100 log_sparsity_every_n_steps: 100 eval_every_n_steps: 100 val_split: test val_holdout_fraction: 0.01 val_max_batches: 20 wandb_project: nodesparse_adv_pretraining wandb_run_name: ci_thresholding_l0_0.05 wandb_entity: null use_wandb: true seed: 0 hf_repo: asher577/ci_thresholding num_workers: 8 resume_from_checkpoint: null use_torch_compile: false torch_compile_mode: default torch_compile_backend: inductor ablation: ci_fn_type: global_reverse_residual d_resid_ci_fn: 1024 reader_hidden_dims: 1024,1024 use_attn_transitions: false attn_n_heads: 4 attn_max_len: 2048 ci_targets: attn_q,attn_k,attn_v,attn_out,mlp_pre,mlp_out ablation_mode: pgd stochastic_n_bins: 10 pgd_init: random pgd_lr: 0.2 pgd_n_steps: 2 pgd_use_sign_grad: true pgd_outer_lr: 0.0 minimality_coeff: 1.0e-05 minimality_coeff_final_frac: 1.0 minimality_coeff_annealing: true minimality_coeff_anneal_start_frac: 0.01 minimality_coeff_anneal_end_frac: 0.7 minimality_coeff_anneal_type: linear minimality_pnorm: 2.0 minimality_eps: 5.0e-07 minimality_beta: 0.5 minimality_p_anneal_start_frac: 0.01 minimality_p_anneal_final_p: 0.5 minimality_p_anneal_end_frac: 0.5 initial_ci: 1.0 minimality_warmup_frac: 0.02 ci_thresholding: 0.1 ci_learning_rate: null