Siyuc commited on
Commit
fdccfbd
·
verified ·
1 Parent(s): e46197b

Add Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci step 26703

Browse files

Native weights-only checkpoint export. Source and safetensors were strictly reconstructed and verified locally before upload.

Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/README.md ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ # Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci step 26,703
2
+
3
+ Native weights-only export for Lookahead with causal refiner memory. This checkpoint represents 7,000,031,232 consumed input tokens.
4
+
5
+ `model.safetensors` contains the native Megatron model state only. It excludes optimizer, scheduler, RNG, dataloader, datasets, caches, logs, and credentials. It is not a Transformers `AutoModel.from_pretrained` checkpoint.
6
+
7
+ Use the exact training code revision and strict loading instructions in `config.json`. Use `manifest.json` to verify payload hashes.
Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/config.json ADDED
@@ -0,0 +1,1389 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architecture": "lookahead",
3
+ "backbone_profile": "paper2604_vanilla",
4
+ "checkpoint_format": "safetensors_native_megatron_state_dict",
5
+ "checkpoint_version": 3.0,
6
+ "excluded_null_extra_state_keys": [],
7
+ "excluded_state": [
8
+ "optimizer",
9
+ "opt_param_scheduler",
10
+ "rng_state",
11
+ "dataloader"
12
+ ],
13
+ "iteration": 26703,
14
+ "loading": {
15
+ "format": "native Megatron model state saved with safetensors; not a Transformers AutoModel",
16
+ "instructions": "Construct lookahead_tf.hf.model.LookaheadTransformer with model_config and lookahead_config at training_code_revision, remove exactly the model. prefix, then call load_state_dict(..., strict=True, assign=True).",
17
+ "key_prefix": "model."
18
+ },
19
+ "lookahead_config": {
20
+ "allow_objective_change_on_resume": false,
21
+ "attention_backend": "sdpa_auto",
22
+ "cache_layer_indices": null,
23
+ "checkpoint_refiner": false,
24
+ "draft_loss_weight": 0.2,
25
+ "feedback_loss_weight": 1.0,
26
+ "future_gradient_mode": "all",
27
+ "future_loss_weight": 0.2,
28
+ "mode": "parallel",
29
+ "normalize_feedback_embedding": false,
30
+ "normalize_feedback_output": false,
31
+ "num_passes": 3,
32
+ "pseudo_initializer": "A2",
33
+ "pseudo_temperature": 1.0,
34
+ "pseudo_top_k": 128,
35
+ "refined_future_loss_weight": 0.0,
36
+ "refiner_gate_bias": -2.0,
37
+ "refiner_intermediate_size": 5632,
38
+ "refiner_memory": true,
39
+ "refiner_memory_only": true,
40
+ "refiner_variant": "R0"
41
+ },
42
+ "model_arguments": {
43
+ "_is_global_batch_size_explicitly_specified": true,
44
+ "account_for_embedding_in_pipeline_split": false,
45
+ "account_for_loss_in_pipeline_split": false,
46
+ "accumulate_allreduce_grads_in_fp32": true,
47
+ "activation_func_clamp_value": null,
48
+ "activation_offload_fraction": 1.0,
49
+ "adam_beta1": 0.8,
50
+ "adam_beta2": 0.95,
51
+ "adam_eps": 1e-10,
52
+ "adaptive_muon_beta2": 0.95,
53
+ "adaptive_muon_eps": 1e-10,
54
+ "adaptive_muon_moment2_method": "normuon",
55
+ "add_bias_linear": false,
56
+ "add_position_embedding": true,
57
+ "add_qkv_bias": false,
58
+ "adlr_autoresume": false,
59
+ "adlr_autoresume_interval": 1000,
60
+ "align_grad_reduce": true,
61
+ "align_param_gather": false,
62
+ "allow_ambiguous_pad_tokens": false,
63
+ "app_tag_run_name": null,
64
+ "app_tag_run_version": "0.0.0",
65
+ "apply_query_key_layer_scaling": false,
66
+ "apply_residual_connection_post_layernorm": false,
67
+ "apply_rope_fusion": false,
68
+ "apply_wd_to_qk_layernorm": false,
69
+ "architecture": "lookahead",
70
+ "architecture_module": [],
71
+ "async_ckpt_cpu_priority": 10,
72
+ "async_ckpt_io_priority": 3,
73
+ "async_ckpt_use_cpu_shm": false,
74
+ "async_save": false,
75
+ "async_strategy": "mcore",
76
+ "attention_backend": "AttnBackend.auto",
77
+ "attention_cp_layout": "zigzag",
78
+ "attention_dropout": 0.0,
79
+ "attention_output_gate": false,
80
+ "attention_softmax_in_fp32": false,
81
+ "auto_detect_ckpt_format": false,
82
+ "backbone_metadata": {
83
+ "activation": "squared_relu",
84
+ "activation_checkpointing": false,
85
+ "allow_objective_change_on_resume": false,
86
+ "attention": "full_causal",
87
+ "attention_output_gate": false,
88
+ "backbone_profile": "paper2604_vanilla",
89
+ "bias": false,
90
+ "block_application_multiplier": 6.449999999999999,
91
+ "cache_layer_indices": [
92
+ 0,
93
+ 10,
94
+ 19
95
+ ],
96
+ "checkpoint_refiner": false,
97
+ "crop_padding_before_loss": true,
98
+ "draft_loss_weight": 0.2,
99
+ "dropout": 0.0,
100
+ "execution_architecture": "lookahead",
101
+ "feedback_loss_weight": 1.0,
102
+ "ffn_hidden_size": 5632,
103
+ "future_gradient_mode": "all",
104
+ "future_loss_weight": 0.2,
105
+ "head_dim": 128,
106
+ "hidden_size": 1408,
107
+ "initialization": {
108
+ "embedding_normal_std": 1.0,
109
+ "head_normal_std": 0.001,
110
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
111
+ "norm_scale": 1.0
112
+ },
113
+ "logit_softcap": 15.0,
114
+ "lookahead_mode": "parallel",
115
+ "model_level_norms": [
116
+ "embedding",
117
+ "recur",
118
+ "final"
119
+ ],
120
+ "norm_epsilon": 1e-06,
121
+ "normalize_feedback_embedding": false,
122
+ "normalize_feedback_output": false,
123
+ "num_attention_heads": 11,
124
+ "num_kv_heads": 11,
125
+ "num_layers": 20,
126
+ "objective": "lookahead_parallel_next_token",
127
+ "padded_vocab_size": 32064,
128
+ "parameter_counts": {
129
+ "backbone_total_trainable": 566144128,
130
+ "feedback_parameters": 3964928,
131
+ "lookahead_parameters": 105083264,
132
+ "non_embedding_matrix_formula": 475791360,
133
+ "non_embedding_paper_N": 475851904,
134
+ "total_parameters": 671227392,
135
+ "total_trainable": 671227392
136
+ },
137
+ "projection_dtype": "bfloat16 (production)",
138
+ "pseudo_backend": "sdpa_auto",
139
+ "pseudo_initializer": "A2",
140
+ "pseudo_temperature": 1.0,
141
+ "pseudo_top_k": 128,
142
+ "qk_norm": "functional_rmsnorm_after_rope",
143
+ "refined_future_loss_weight": 0.0,
144
+ "refiner_activation": "silu_gated",
145
+ "refiner_memory": true,
146
+ "refiner_memory_only": true,
147
+ "refiner_variant": "R0",
148
+ "residual_and_norm_scale_dtype": "float32",
149
+ "residual_multiplier": 1.0,
150
+ "rope_base": 10000.0,
151
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
152
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
153
+ "tied_embeddings": false,
154
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
155
+ "train_passes": 3,
156
+ "vocab_size": 32001,
157
+ "width_scale": 22
158
+ },
159
+ "backbone_profile": "paper2604_vanilla",
160
+ "barrier_with_L1_time": true,
161
+ "batch_invariant_backend": "te_native",
162
+ "batch_invariant_collective": "ordered",
163
+ "batch_invariant_mode": false,
164
+ "bert_binary_head": true,
165
+ "bert_embedder_type": "megatron",
166
+ "bert_load": null,
167
+ "bf16": true,
168
+ "bias_dropout_fusion": false,
169
+ "bias_gelu_fusion": false,
170
+ "bias_swiglu_fusion": true,
171
+ "biencoder_projection_dim": 0,
172
+ "biencoder_shared_query_context_model": false,
173
+ "block_data_path": null,
174
+ "cache_mla_latents": false,
175
+ "calc_ft_timeouts": false,
176
+ "calculate_per_token_loss": false,
177
+ "chat_template": null,
178
+ "check_for_large_grads": false,
179
+ "check_for_nan_in_loss_and_grad": true,
180
+ "check_for_spiky_loss": false,
181
+ "check_weight_hash_across_dp_replicas_interval": null,
182
+ "ckpt_assume_constant_structure": false,
183
+ "ckpt_convert_format": null,
184
+ "ckpt_convert_save": null,
185
+ "ckpt_convert_update_legacy_dist_opt_format": false,
186
+ "ckpt_drop_redundant_extra_state": false,
187
+ "ckpt_format": "torch",
188
+ "ckpt_fully_parallel_load": false,
189
+ "ckpt_fully_parallel_load_exchange_algo": "broadcast",
190
+ "ckpt_fully_parallel_load_per_rank_objects": false,
191
+ "ckpt_fully_parallel_load_process_group": "dp",
192
+ "ckpt_fully_parallel_save": true,
193
+ "ckpt_fully_parallel_save_deprecated": false,
194
+ "ckpt_fully_parallel_save_process_group": "dp",
195
+ "ckpt_load_validate_sharding_integrity": true,
196
+ "ckpt_pg_tensors_cache_create": false,
197
+ "ckpt_pg_tensors_cache_path": null,
198
+ "ckpt_step": null,
199
+ "classes_fraction": 1.0,
200
+ "clip_grad": 0.0,
201
+ "clone_scatter_output_in_embedding": true,
202
+ "config_logger_dir": "",
203
+ "consumed_train_samples": 3417984,
204
+ "consumed_valid_samples": 68608,
205
+ "context_parallel_size": 1,
206
+ "cp_comm_type": [
207
+ "p2p"
208
+ ],
209
+ "cpu_offloading_num_layers": 0,
210
+ "cpu_offloading_retain_pinned_cpu_buffers": false,
211
+ "create_all_gather_group": false,
212
+ "create_attention_mask_in_dataloader": false,
213
+ "cross_entropy_fusion_impl": "native",
214
+ "cross_entropy_loss_fusion": false,
215
+ "csa_compress_ratios": null,
216
+ "csa_compress_rotary_base": 40000.0,
217
+ "csa_dense_mode": false,
218
+ "csa_window_size": 128,
219
+ "cuda_graph_impl": "none",
220
+ "cuda_graph_modules": [],
221
+ "cuda_graph_warmup_steps": 3,
222
+ "curr_iteration": 26702,
223
+ "data_args_path": null,
224
+ "data_cache_path": null,
225
+ "data_parallel_random_init": false,
226
+ "data_parallel_sharding_strategy": "optim_grads_params",
227
+ "data_parallel_size": 16,
228
+ "data_path": null,
229
+ "data_per_class_fraction": 1.0,
230
+ "data_sharding": true,
231
+ "dataloader_defer_npy_index_mmap": false,
232
+ "dataloader_fast_cache_load": false,
233
+ "dataloader_inter_document_masking": false,
234
+ "dataloader_save": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204652_lookahead-memoryonly-relaunch/dataloader",
235
+ "dataloader_type": "external",
236
+ "ddp_average_in_collective": false,
237
+ "ddp_bucket_size": null,
238
+ "ddp_num_buckets": null,
239
+ "ddp_pad_buckets_for_high_nccl_busbw": false,
240
+ "ddp_param_name_patterns_for_fp32_local_accumulation": [],
241
+ "ddp_reduce_scatter_with_fp32_accumulation": false,
242
+ "decode_only_cuda_graphs": false,
243
+ "decoder_first_pipeline_num_layers": null,
244
+ "decoder_last_pipeline_num_layers": null,
245
+ "decoder_num_layers": null,
246
+ "decoder_seq_length": null,
247
+ "decoupled_lr": null,
248
+ "decoupled_min_lr": null,
249
+ "decrease_batch_size_if_needed": false,
250
+ "defer_embedding_wgrad_compute": false,
251
+ "delay_offload_until_cuda_graph": false,
252
+ "delay_wgrad_compute": false,
253
+ "delta_offload_bytes_across_pp_ranks": 0,
254
+ "deprecated_use_mcore_models": false,
255
+ "deterministic_mode": false,
256
+ "dino_bottleneck_size": 256,
257
+ "dino_freeze_last_layer": 1,
258
+ "dino_head_hidden_size": 2048,
259
+ "dino_local_crops_number": 10,
260
+ "dino_local_img_size": 96,
261
+ "dino_norm_last_layer": false,
262
+ "dino_teacher_temp": 0.07,
263
+ "dino_warmup_teacher_temp": 0.04,
264
+ "dino_warmup_teacher_temp_epochs": 30,
265
+ "disable_bf16_reduced_precision_matmul": false,
266
+ "disable_jit_fuser": false,
267
+ "disable_msc_deprecated": false,
268
+ "disable_straggler_on_startup": false,
269
+ "disable_symmetric_registration": false,
270
+ "dist_ckpt_format_deprecated": null,
271
+ "dist_ckpt_optim_fully_reshardable": false,
272
+ "dist_ckpt_save_pre_mcore_014": false,
273
+ "dist_ckpt_strictness": "assume_ok_unexpected",
274
+ "dist_ckpt_workers": 1,
275
+ "distrib_optim_fully_reshardable_mem_efficient": false,
276
+ "distribute_saved_activations": false,
277
+ "distributed_backend": "nccl",
278
+ "distributed_timeout_minutes": 10,
279
+ "distributed_timeout_seconds_after_init": null,
280
+ "do_test": 0,
281
+ "do_train": 1,
282
+ "do_valid": 1,
283
+ "dsa_indexer_head_dim": null,
284
+ "dsa_indexer_k_norm_epsilon": null,
285
+ "dsa_indexer_k_norm_fp32": false,
286
+ "dsa_indexer_loss_coeff": null,
287
+ "dsa_indexer_n_heads": null,
288
+ "dsa_indexer_rope_interleaved": false,
289
+ "dsa_indexer_rotate_activation": true,
290
+ "dsa_indexer_scoring_relu": true,
291
+ "dsa_indexer_skip_topk_offset": 0,
292
+ "dsa_indexer_topk": null,
293
+ "dsa_indexer_topk_freq": 1,
294
+ "dsa_indexer_use_sparse_loss": false,
295
+ "dsa_kernel_backend": "none",
296
+ "dump_param_to_param_group_map": null,
297
+ "embedding_init_method_std": null,
298
+ "embedding_path": null,
299
+ "empty_unused_memory_level": 0,
300
+ "enable_chunked_prefill": false,
301
+ "enable_cuda_graph": false,
302
+ "enable_experimental": false,
303
+ "enable_ft_package": false,
304
+ "enable_full_sharding_in_hsdp": false,
305
+ "enable_mhc_connections": false,
306
+ "enable_msc": false,
307
+ "enable_one_logger": true,
308
+ "encoder_num_layers": 20,
309
+ "encoder_seq_length": 2048,
310
+ "end_weight_decay": 0.0,
311
+ "eod_mask_loss": false,
312
+ "ep_overlap_early_attn_memory_release": false,
313
+ "error_injection_rate": 0,
314
+ "error_injection_type": "transient_error",
315
+ "eval_at_start": true,
316
+ "eval_global_batch_size": 128,
317
+ "eval_interval": 100,
318
+ "eval_iters": 2,
319
+ "eval_micro_batch_size": 8,
320
+ "evaluation_metadata": {
321
+ "eval_at_start": true,
322
+ "final_validation_input_tokens": 70778880,
323
+ "final_validation_iters": 270,
324
+ "final_validation_sequences": 34560,
325
+ "global_batch_size": 128,
326
+ "initial_iters": 2,
327
+ "intermediate_input_tokens": 524288,
328
+ "intermediate_iters": 2,
329
+ "sequence_length": 2048,
330
+ "test_iters": 0,
331
+ "validation_iterator": "continues_existing_held_out_iterator"
332
+ },
333
+ "evidence_data_path": null,
334
+ "exit_duration_in_mins": null,
335
+ "exit_interval": null,
336
+ "exit_on_missing_checkpoint": false,
337
+ "exit_signal": 15,
338
+ "exit_signal_handler": false,
339
+ "exit_signal_handler_for_dataloader": false,
340
+ "exit_signal_handler_for_training": false,
341
+ "exp_avg_dtype": "torch.float32",
342
+ "exp_avg_sq_dtype": "torch.float32",
343
+ "experimental_attention_variant": null,
344
+ "expert_data_parallel_sharding_strategy": null,
345
+ "expert_gtp_weight_remat_size": 1,
346
+ "expert_model_parallel_size": 1,
347
+ "expert_tensor_parallel_num_weight_shards": 1,
348
+ "expert_tensor_parallel_size": 1,
349
+ "external_cuda_graph": false,
350
+ "fake_process_group": false,
351
+ "fault_injector_delay_start_iteration": null,
352
+ "fault_injector_fault_delay": null,
353
+ "fault_injector_fault_probabilities": null,
354
+ "fault_injector_fault_types": null,
355
+ "fault_injector_mtti_seconds": null,
356
+ "fault_injector_num_ranks": null,
357
+ "fault_injector_offset_seconds": null,
358
+ "fault_injector_ranks": null,
359
+ "fault_injector_seed": null,
360
+ "feedback_normuon_beta2": 0.95,
361
+ "feedback_scalar_lr": 0.0005,
362
+ "feedback_scalar_weight_decay": 0.0,
363
+ "feedback_z_loss_coefficient": 0.0,
364
+ "feedback_z_loss_start_fraction": 1.0,
365
+ "ffn_hidden_size": 5632,
366
+ "fim_data": false,
367
+ "fim_eod_token": "<|endoftext|>",
368
+ "fim_fragment_rate": null,
369
+ "fim_middle_token": "<fim_middle>",
370
+ "fim_no_prefix": null,
371
+ "fim_pad_token": "<fim_pad>",
372
+ "fim_prefix_token": "<fim_prefix>",
373
+ "fim_rate": 0.5,
374
+ "fim_split_sample": null,
375
+ "fim_spm_rate": 0.5,
376
+ "fim_suffix_token": "<fim_suffix>",
377
+ "final_eval_iters": 270,
378
+ "fine_grained_activation_offloading": false,
379
+ "fine_grained_offloading_max_inflight_offloads": null,
380
+ "finetune": false,
381
+ "first_last_layers_bf16": false,
382
+ "flash_attention_version": null,
383
+ "flash_decode": false,
384
+ "flight_recorder_dump_on_timeout": true,
385
+ "flight_recorder_dump_path": null,
386
+ "flight_recorder_extra_dump_on_exec": true,
387
+ "flight_recorder_include_only_active": true,
388
+ "flight_recorder_include_stack_trace": false,
389
+ "flight_recorder_trace_buffer_size": 2000,
390
+ "fp16": false,
391
+ "fp16_lm_cross_entropy": false,
392
+ "fp32_residual_connection": false,
393
+ "fp4": null,
394
+ "fp4_param_gather": false,
395
+ "fp4_quantizer_factory": null,
396
+ "fp4_recipe": "nvfp4",
397
+ "fp8": null,
398
+ "fp8_amax_compute_algo": "most_recent",
399
+ "fp8_amax_history_len": 1,
400
+ "fp8_interval": 1,
401
+ "fp8_margin": 0,
402
+ "fp8_output_proj": false,
403
+ "fp8_param_gather": false,
404
+ "fp8_quantizer_factory": null,
405
+ "fp8_recipe": "delayed",
406
+ "fp8_wgrad": true,
407
+ "freeze_all_layers": false,
408
+ "fsdp_db_use_persist_buf_on_alloc_fail": false,
409
+ "fsdp_double_buffer": false,
410
+ "fsdp_manual_registration": false,
411
+ "ft_num_warmup_iters": 5,
412
+ "full_validation": false,
413
+ "fused_residual_rmsnorm": false,
414
+ "gdp_cutedsl_kernel": false,
415
+ "gdp_num_chunk_states_to_recompute": 2,
416
+ "gdp_num_householder": 3,
417
+ "global_batch_size": 128,
418
+ "glu_linear_offset": 0.0,
419
+ "gpu_sniff_test_interval": null,
420
+ "grad_reduce_in_bf16": false,
421
+ "gradient_accumulation_fusion": false,
422
+ "gradient_reduce_div_fusion": true,
423
+ "group_query_attention": false,
424
+ "grpo_clamp_eps_lower": 0.01,
425
+ "grpo_clamp_eps_upper": 0.01,
426
+ "grpo_entropy_term_weight": 0.0,
427
+ "grpo_filter_groups_with_same_reward": false,
428
+ "grpo_group_size": 2,
429
+ "grpo_iterations": 2,
430
+ "grpo_kl_beta": 0.001,
431
+ "grpo_prompts_per_step": 32,
432
+ "gtp_expert_remat_nccl_ub": false,
433
+ "gtp_remat_nccl_ub": false,
434
+ "gtp_remat_opt_in_modules": [],
435
+ "gtp_remat_reduce_scatter_with_fp32_accumulation": false,
436
+ "gtp_weight_remat_size": 1,
437
+ "head_lr_mult": 1.0,
438
+ "heterogeneous_layers_config_encoded_json": null,
439
+ "heterogeneous_layers_config_path": null,
440
+ "hfsdp_param_gather_overlap": false,
441
+ "hidden_dropout": 0.0,
442
+ "hidden_size": 1408,
443
+ "hierarchical_context_parallel_sizes": null,
444
+ "high_priority_a2a_comm_stream": false,
445
+ "high_priority_stream_groups": [],
446
+ "hybrid_context_parallel": false,
447
+ "hybrid_layer_pattern": null,
448
+ "hybrid_override_pattern": null,
449
+ "hysteresis": 2,
450
+ "ict_head_size": null,
451
+ "ict_load": null,
452
+ "img_h": 224,
453
+ "img_w": 224,
454
+ "indexer_batch_size": 128,
455
+ "indexer_log_interval": 1000,
456
+ "inference_batch_times_seqlen_threshold": -1,
457
+ "inference_coordinator_port": null,
458
+ "inference_cuda_graph_all_prefills": false,
459
+ "inference_cuda_graph_max_tokens": 512,
460
+ "inference_cuda_graph_scope": "InferenceCudaGraphScope.none",
461
+ "inference_disable_ep_consensus": false,
462
+ "inference_disable_triton_nvls_kernels": false,
463
+ "inference_dynamic_batching": false,
464
+ "inference_dynamic_batching_allow_stale_multimodal_embeddings": false,
465
+ "inference_dynamic_batching_async_sched_mode": "async",
466
+ "inference_dynamic_batching_block_size": 256,
467
+ "inference_dynamic_batching_buffer_size_gb": 40.0,
468
+ "inference_dynamic_batching_cuda_graph_mixed_prefill_count": 16,
469
+ "inference_dynamic_batching_cuda_graph_sizing_distribution": "hybrid",
470
+ "inference_dynamic_batching_enable_prefix_caching": false,
471
+ "inference_dynamic_batching_logprobs_mode": "raw_logprobs",
472
+ "inference_dynamic_batching_mamba_memory_ratio": null,
473
+ "inference_dynamic_batching_max_requests": null,
474
+ "inference_dynamic_batching_max_tokens": null,
475
+ "inference_dynamic_batching_media_cache_coordinator_policy": "affinity",
476
+ "inference_dynamic_batching_media_cache_routing_weight": 1.0,
477
+ "inference_dynamic_batching_num_cuda_graphs": 16,
478
+ "inference_dynamic_batching_paused_buffer_size_gb": null,
479
+ "inference_dynamic_batching_prefix_cache_ttl_seconds": 300.0,
480
+ "inference_dynamic_batching_prefix_caching_coordinator_policy": "longest_prefix",
481
+ "inference_dynamic_batching_prefix_caching_eviction_policy": "lru",
482
+ "inference_dynamic_batching_prefix_caching_mamba_gb": null,
483
+ "inference_dynamic_batching_prefix_caching_routing_alpha": 1.0,
484
+ "inference_dynamic_batching_sampling_backend": "torch",
485
+ "inference_dynamic_batching_track_generated_token_events": false,
486
+ "inference_dynamic_batching_track_paused_request_events": false,
487
+ "inference_dynamic_batching_unified_memory_level": 0,
488
+ "inference_dynamic_batching_vision_embedding_cache_max_bytes": 0,
489
+ "inference_flashinfer_mxfp8_token_capacity": null,
490
+ "inference_fuse_tp_communication": false,
491
+ "inference_grouped_gemm_backend": "vllm",
492
+ "inference_logging_step_interval": 0,
493
+ "inference_max_requests": 8,
494
+ "inference_max_seq_length": 2560,
495
+ "inference_moe_disable_fused_quant_kernels": false,
496
+ "inference_moe_token_dispatcher_type": "nvls",
497
+ "inference_rng_tracker": false,
498
+ "inference_shards": null,
499
+ "inference_text_gen_server_logging": false,
500
+ "inference_use_synchronous_zmq_collectives": false,
501
+ "inference_wandb_logging": false,
502
+ "init_method_std": 0.02,
503
+ "init_method_xavier_uniform": false,
504
+ "init_model_with_meta_device": false,
505
+ "initial_loss_scale": 4294967296,
506
+ "inprocess_active_world_size": 16,
507
+ "inprocess_barrier_timeout": 120,
508
+ "inprocess_completion_timeout": 120,
509
+ "inprocess_empty_cuda_cache": false,
510
+ "inprocess_granularity": "node",
511
+ "inprocess_hard_timeout": 90,
512
+ "inprocess_heartbeat_interval": 30,
513
+ "inprocess_heartbeat_timeout": 60,
514
+ "inprocess_last_call_wait": 1,
515
+ "inprocess_max_iterations": null,
516
+ "inprocess_monitor_process_interval": 1.0,
517
+ "inprocess_monitor_thread_interval": 1.0,
518
+ "inprocess_progress_watchdog_interval": 1.0,
519
+ "inprocess_restart": false,
520
+ "inprocess_soft_timeout": 60,
521
+ "inprocess_termination_grace_time": 1,
522
+ "is_hybrid_model": false,
523
+ "iter_per_epoch": 1250,
524
+ "iteration": 0,
525
+ "iterations_to_skip": [],
526
+ "keep_fp8_transpose_cache": false,
527
+ "kitchen_attention_backend": "sdpa",
528
+ "kv_channels": 128,
529
+ "kv_lora_rank": 32,
530
+ "langrl_env_config": null,
531
+ "layernorm_epsilon": 1e-06,
532
+ "layernorm_zero_centered_gamma": false,
533
+ "lazy_mpu_init": false,
534
+ "linear_attention_freq": null,
535
+ "linear_conv_kernel_dim": 4,
536
+ "linear_cp_layout": "zigzag",
537
+ "linear_cp_mode": "headwise",
538
+ "linear_key_head_dim": 128,
539
+ "linear_num_key_heads": 16,
540
+ "linear_num_value_heads": 32,
541
+ "linear_value_head_dim": 128,
542
+ "lion_beta1": 0.95,
543
+ "lion_beta2": 0.98,
544
+ "load": null,
545
+ "load_main_params_from_ckpt": false,
546
+ "local_rank": 0,
547
+ "log_device_memory_used": false,
548
+ "log_energy": false,
549
+ "log_interval": 1,
550
+ "log_loss_scale_to_tensorboard": true,
551
+ "log_max_attention_logit": false,
552
+ "log_memory_interval": null,
553
+ "log_memory_to_tensorboard": false,
554
+ "log_num_zeros_in_grad": false,
555
+ "log_params_norm": false,
556
+ "log_progress": false,
557
+ "log_straggler": false,
558
+ "log_throughput": false,
559
+ "log_timers_to_tensorboard": true,
560
+ "log_validation_ppl_to_tensorboard": false,
561
+ "log_world_size_to_tensorboard": false,
562
+ "logging_level": null,
563
+ "logit_dtype": null,
564
+ "logits_load_decode_threads": 4,
565
+ "logits_load_dir": null,
566
+ "logits_load_ignore_errors": false,
567
+ "logits_load_kd_loss_alpha": 1.0,
568
+ "logits_load_msc_prefetch_depth": 2,
569
+ "logits_load_prefetch_factor": 3,
570
+ "logits_save_dir": null,
571
+ "logits_save_dtype": "fp16",
572
+ "logits_save_top_k": null,
573
+ "logits_save_top_p": null,
574
+ "logits_save_top_p_min_k": 1,
575
+ "lookahead_allow_objective_change_on_resume": false,
576
+ "lookahead_attention_backend": "sdpa_auto",
577
+ "lookahead_cache_layers": null,
578
+ "lookahead_checkpoint_refiner": false,
579
+ "lookahead_draft_loss_weight": 0.2,
580
+ "lookahead_feedback_loss_weight": 1.0,
581
+ "lookahead_full_attention_interval": 6,
582
+ "lookahead_future_gradient_mode": "all",
583
+ "lookahead_future_loss_weight": 0.2,
584
+ "lookahead_gradient_checkpointing": false,
585
+ "lookahead_mode": "parallel",
586
+ "lookahead_normalize_feedback_embedding": false,
587
+ "lookahead_normalize_feedback_output": false,
588
+ "lookahead_num_passes": 3,
589
+ "lookahead_pseudo_initializer": "A2",
590
+ "lookahead_pseudo_temperature": 1.0,
591
+ "lookahead_pseudo_top_k": 128,
592
+ "lookahead_refined_future_loss_weight": 0.0,
593
+ "lookahead_refiner_ffn_size": 5632,
594
+ "lookahead_refiner_gate_bias": -2.0,
595
+ "lookahead_refiner_memory": true,
596
+ "lookahead_refiner_memory_only": true,
597
+ "lookahead_refiner_variant": "R0",
598
+ "lookahead_sliding_window": 2048,
599
+ "lookahead_z_loss_coefficient": 0.0,
600
+ "loss_scale": null,
601
+ "loss_scale_window": 1000,
602
+ "lr": 0.007470638533717786,
603
+ "lr_decay_iters": null,
604
+ "lr_decay_samples": null,
605
+ "lr_decay_style": "linear",
606
+ "lr_warmup_fraction": null,
607
+ "lr_warmup_init": 0.0,
608
+ "lr_warmup_iters": 0,
609
+ "lr_warmup_samples": 0,
610
+ "lr_wsd_decay_iters": 0,
611
+ "lr_wsd_decay_samples": null,
612
+ "lr_wsd_decay_style": "linear",
613
+ "main_grads_dtype": "torch.float32",
614
+ "main_params_dtype": "torch.float32",
615
+ "make_vocab_size_divisible_by": 64,
616
+ "mamba_head_dim": 64,
617
+ "mamba_inference_conv_states_dtype": "torch.bfloat16",
618
+ "mamba_inference_ssm_states_dtype": "torch.bfloat16",
619
+ "mamba_num_groups": 8,
620
+ "mamba_num_heads": null,
621
+ "mamba_state_dim": 128,
622
+ "mamba_training_ssm_states_dtype": null,
623
+ "manual_gc": false,
624
+ "manual_gc_eval": true,
625
+ "manual_gc_interval": 0,
626
+ "mask_factor": 1.0,
627
+ "mask_prob": 0.15,
628
+ "mask_type": "random",
629
+ "masked_softmax_fusion": true,
630
+ "max_position_embeddings": 2048,
631
+ "max_seqlen_per_dp_cp_rank": null,
632
+ "max_tokens_to_oom": 12000,
633
+ "megatron_fsdp_enable_fine_grained_param_gather": false,
634
+ "megatron_fsdp_grad_comm_dtype": null,
635
+ "megatron_fsdp_main_grads_dtype": null,
636
+ "megatron_fsdp_main_params_dtype": "torch.float32",
637
+ "megatron_fsdp_max_pool_double_buffer": false,
638
+ "megatron_fsdp_version": 1,
639
+ "megatron_lm_path": "/root/dl/runtime/Megatron-LM",
640
+ "memory_snapshot_path": "snapshot.pickle",
641
+ "merge_file": null,
642
+ "metadata_path": null,
643
+ "mhc_fused_backend": "auto",
644
+ "mhc_init_gating_factor": 0.01,
645
+ "mhc_num_residual_streams": 4,
646
+ "mhc_recompute_layer_num": null,
647
+ "mhc_sinkhorn_iterations": 20,
648
+ "micro_batch_size": 8,
649
+ "microbatch_group_size_per_vp_stage": null,
650
+ "mid_level_dataset_surplus": 0.005,
651
+ "min_loss_scale": 1.0,
652
+ "min_lr": 0.0007470638533717787,
653
+ "min_offloaded_tensor_size": 1048576,
654
+ "mla_down_proj_fusion": false,
655
+ "mlp_chunks_for_prefill": 1,
656
+ "mlp_chunks_for_training": 1,
657
+ "mmap_bin_files": true,
658
+ "mock_data": false,
659
+ "moe_apply_probs_on_input": false,
660
+ "moe_aux_loss_coeff": 0.0,
661
+ "moe_combine_bwd_dtype": "bf16",
662
+ "moe_deepep_num_sms": null,
663
+ "moe_dispatch_fwd_dtype": "bf16",
664
+ "moe_enable_deepep": false,
665
+ "moe_enable_routing_replay": false,
666
+ "moe_expert_capacity_factor": null,
667
+ "moe_expert_rank_capacity_factor": null,
668
+ "moe_ffn_hidden_size": null,
669
+ "moe_flex_dispatcher_backend": "deepep",
670
+ "moe_flex_dispatcher_num_sms": null,
671
+ "moe_grouped_gemm": false,
672
+ "moe_hybridep_num_blocks_permute": null,
673
+ "moe_hybridep_num_blocks_unpermute": null,
674
+ "moe_hybridep_num_sms": null,
675
+ "moe_hybridep_num_sms_preprocessing": 108,
676
+ "moe_hybridep_pad_uneven_dispatch_inputs": false,
677
+ "moe_input_jitter_eps": null,
678
+ "moe_latent_size": null,
679
+ "moe_layer_freq": 1,
680
+ "moe_layer_recompute": false,
681
+ "moe_mlp_glu_interleave_size": null,
682
+ "moe_ncclep_zero_copy": false,
683
+ "moe_pad_expert_input_to_capacity": false,
684
+ "moe_pad_experts_for_cuda_graph_inference": false,
685
+ "moe_paged_stash": false,
686
+ "moe_paged_stash_buffer_size_factor_cpu": 0.0,
687
+ "moe_paged_stash_buffer_size_factor_cuda": 1.1,
688
+ "moe_paged_stash_page_size": 64,
689
+ "moe_per_layer_logging": false,
690
+ "moe_permute_fusion": false,
691
+ "moe_permute_fusion_into_hybridep": false,
692
+ "moe_router_bias_update_rate": 0.001,
693
+ "moe_router_dtype": null,
694
+ "moe_router_enable_expert_bias": false,
695
+ "moe_router_force_biased": null,
696
+ "moe_router_force_load_balancing": false,
697
+ "moe_router_fusion": false,
698
+ "moe_router_group_topk": null,
699
+ "moe_router_load_balancing_type": "aux_loss",
700
+ "moe_router_num_groups": null,
701
+ "moe_router_padding_for_fp8": false,
702
+ "moe_router_padding_for_quantization": false,
703
+ "moe_router_pre_softmax": false,
704
+ "moe_router_quantile_balancing_ema": 0.0,
705
+ "moe_router_score_function": "softmax",
706
+ "moe_router_skip_muon": false,
707
+ "moe_router_topk": 2,
708
+ "moe_router_topk_scaling_factor": null,
709
+ "moe_routing_trace_capture_hidden_states": false,
710
+ "moe_routing_trace_capture_logits": false,
711
+ "moe_routing_trace_dump_weights": false,
712
+ "moe_routing_trace_max_training_iters": null,
713
+ "moe_routing_trace_path": null,
714
+ "moe_shared_expert_gate": false,
715
+ "moe_shared_expert_glu_interleave_size": null,
716
+ "moe_shared_expert_intermediate_size": null,
717
+ "moe_shared_expert_overlap": false,
718
+ "moe_single_grouped_bias": false,
719
+ "moe_single_grouped_weight": false,
720
+ "moe_token_dispatcher_type": "allgather",
721
+ "moe_token_drop_policy": "probs",
722
+ "moe_upcycling_granularity": 1,
723
+ "moe_use_grouped_tensor": false,
724
+ "moe_use_norm_before_up_proj": false,
725
+ "moe_use_upcycling": false,
726
+ "moe_z_loss_coeff": null,
727
+ "mrope_section": null,
728
+ "mscale": 1.0,
729
+ "mscale_all_dim": 0.0,
730
+ "mtp_detach_heads": false,
731
+ "mtp_hsm": false,
732
+ "mtp_hybrid_override_pattern": null,
733
+ "mtp_loss_scaling_factor": 0.1,
734
+ "mtp_num_layers": null,
735
+ "mtp_standalone": false,
736
+ "mtp_use_repeated_layer": false,
737
+ "multi_latent_attention": false,
738
+ "multiple_validation_sets": false,
739
+ "muon_coefficient_type": "quintic",
740
+ "muon_extra_scale_factor": 1.0,
741
+ "muon_fp32_matmul_prec": "medium",
742
+ "muon_momentum": 0.95,
743
+ "muon_nesterov": true,
744
+ "muon_num_ns_steps": 5,
745
+ "muon_scalar_optimizer": "adam",
746
+ "muon_scale_mode": "spectral",
747
+ "muon_split_qkv": true,
748
+ "muon_tp_mode": "duplicated",
749
+ "muon_use_syrk": false,
750
+ "mup_attn_scale_power": 1.0,
751
+ "mup_base_head_dim": null,
752
+ "mup_base_hidden_size": null,
753
+ "mup_embedding_mult": 1.0,
754
+ "mup_output_mult": 1.0,
755
+ "mup_width_mult": 1.0,
756
+ "nccl_all_reduce_for_prefill": false,
757
+ "nccl_communicator_config_path": null,
758
+ "nccl_ub": false,
759
+ "no_load_optim": null,
760
+ "no_load_rng": null,
761
+ "no_persist_layer_norm": false,
762
+ "no_rope_freq": null,
763
+ "no_save_optim": null,
764
+ "no_save_rng": null,
765
+ "no_weight_decay_cond_type": null,
766
+ "non_persistent_ckpt_type": null,
767
+ "non_persistent_global_ckpt_dir": null,
768
+ "non_persistent_local_ckpt_algo": "fully_parallel",
769
+ "non_persistent_local_ckpt_dir": null,
770
+ "non_persistent_save_interval": null,
771
+ "normalization": "RMSNorm",
772
+ "null_tokenizer_eod_id": null,
773
+ "null_tokenizer_pad_id": -1,
774
+ "num_attention_heads": 11,
775
+ "num_channels": 3,
776
+ "num_classes": 1000,
777
+ "num_dataset_builder_threads": 1,
778
+ "num_distributed_optimizer_instances": 1,
779
+ "num_experts": null,
780
+ "num_floating_point_operations_so_far": 0,
781
+ "num_layers": 20,
782
+ "num_layers_at_end_in_bf16": 1,
783
+ "num_layers_at_start_in_bf16": 1,
784
+ "num_layers_per_virtual_pipeline_stage": null,
785
+ "num_query_groups": 11,
786
+ "num_speculative_tokens": 0,
787
+ "num_virtual_stages_per_pipeline_rank": null,
788
+ "num_workers": 0,
789
+ "nvtx_ranges": false,
790
+ "object_storage_cache_path": null,
791
+ "offload_modules": [],
792
+ "offset_sampling_seed_by_dp_rank": true,
793
+ "one_logger_async": false,
794
+ "one_logger_project": "megatron-lm",
795
+ "one_logger_run_name": null,
796
+ "online_data": true,
797
+ "online_data_cache_dir": "/root/dl/runtime/script/loopTF-workspace/data/cache/huggingface",
798
+ "online_dataset": "HuggingFaceFW/fineweb-edu",
799
+ "online_dataset_revision": "87f09149ef4734204d70ed1d046ddc9ca3f2b8f9",
800
+ "online_dataset_subset": "sample-100BT",
801
+ "online_latency_log_dir": null,
802
+ "online_pack_sequences": false,
803
+ "online_prefetch_batches": 16,
804
+ "online_raw_manifest": null,
805
+ "online_shuffle_buffer_records": 128,
806
+ "online_source_mode": "stream",
807
+ "online_source_split": "train",
808
+ "online_split_seed": 260421106,
809
+ "online_text_column": "text",
810
+ "online_tokenizer_batch_size": 256,
811
+ "online_tokenizer_revision": "8efe6c9b93655b934e27bd9981e3ec13e55aee9d",
812
+ "online_validation_fraction": 0.001,
813
+ "online_validation_manifest": "/root/dl/runtime/script/loopTF-workspace/data/validation/manual_14b/manifest.json",
814
+ "onnx_safe": null,
815
+ "openai_gelu": false,
816
+ "optimizer": "muonh",
817
+ "optimizer_cpu_offload": false,
818
+ "optimizer_cuda_graph": false,
819
+ "optimizer_offload_fraction": 1.0,
820
+ "otel_enabled": false,
821
+ "otel_service_name": null,
822
+ "otel_span_groups": null,
823
+ "outer_dp_sharding_strategy": "no_shard",
824
+ "output_bert_embeddings": false,
825
+ "overlap_cpu_optimizer_d2h_h2d": false,
826
+ "overlap_dispatch_backward_with_experts_wgrad": false,
827
+ "overlap_grad_reduce": false,
828
+ "overlap_moe_expert_parallel_comm": false,
829
+ "overlap_p2p_comm": false,
830
+ "overlap_p2p_comm_warmup_flush": false,
831
+ "overlap_param_gather": false,
832
+ "overlap_param_gather_with_optimizer_step": false,
833
+ "override_ckpt_iteration": null,
834
+ "override_opt_param_scheduler": false,
835
+ "pad_vocab_size": true,
836
+ "padded_vocab_size": 32064,
837
+ "paper_base_matrix_lr": 0.014,
838
+ "paper_embedding_lr": 0.3,
839
+ "paper_norm_lr": 0.005,
840
+ "paper_other_lr": 0.005,
841
+ "paper_reference_batch_tokens": 262144,
842
+ "paper_reference_tokens": 983315200,
843
+ "paper_reference_width": 640,
844
+ "paper_transfer": {
845
+ "batch_tokens": 262144,
846
+ "reference_batch_tokens": 262144,
847
+ "reference_tokens": 983315200,
848
+ "reference_width": 640,
849
+ "total_tokens": 7000031232,
850
+ "width": 1408
851
+ },
852
+ "paper_unembedding_lr": 0.004,
853
+ "params_dtype": "torch.bfloat16",
854
+ "patch_dim": 16,
855
+ "per_dataset_sequences_path": null,
856
+ "per_split_data_args_path": null,
857
+ "perform_initialization": true,
858
+ "perform_rl_step": false,
859
+ "phase_transition_iterations": null,
860
+ "pin_cpu_grads": true,
861
+ "pin_cpu_params": true,
862
+ "pipeline_model_parallel_comm_backend": null,
863
+ "pipeline_model_parallel_layout": null,
864
+ "pipeline_model_parallel_size": 1,
865
+ "position_embedding_type": "rope",
866
+ "pretrained_checkpoint": null,
867
+ "profile": false,
868
+ "profile_ranks": [],
869
+ "profile_step_end": 12,
870
+ "profile_step_start": 10,
871
+ "pytorch_profiler_collect_callstack": false,
872
+ "pytorch_profiler_collect_chakra": false,
873
+ "pytorch_profiler_collect_shapes": false,
874
+ "q_lora_rank": null,
875
+ "qk_clip": false,
876
+ "qk_clip_alpha": 0.5,
877
+ "qk_clip_threshold": 100,
878
+ "qk_head_dim": 128,
879
+ "qk_l2_norm": false,
880
+ "qk_layernorm": false,
881
+ "qk_pos_emb_head_dim": 64,
882
+ "query_in_block_prob": 0.1,
883
+ "quick_geglu": false,
884
+ "rampup_batch_size": null,
885
+ "rank": 0,
886
+ "recipe_optimizer": {
887
+ "betas": [
888
+ 0.8,
889
+ 0.95
890
+ ],
891
+ "embedding_lr": 0.3,
892
+ "eps": 1e-10,
893
+ "matrix_lr": 0.014,
894
+ "matrix_weight_decay": 0.0,
895
+ "max_grad_norm": null,
896
+ "name": "muonh",
897
+ "norm_lr": 0.005,
898
+ "normuon_adjust_lr": "spectral_norm",
899
+ "normuon_beta2": 0.95,
900
+ "normuon_momentum": 0.95,
901
+ "normuon_nesterov": true,
902
+ "other_lr": 0.005,
903
+ "scalar_lr": null,
904
+ "scalar_weight_decay": 0.0,
905
+ "unembedding_lr": 0.004
906
+ },
907
+ "recipe_overrides": {},
908
+ "recipe_requested_batch_tokens": 262144,
909
+ "recipe_schedule": {
910
+ "adamc_weight_decay": false,
911
+ "cooldown_fraction": 0.0,
912
+ "cooldown_style": "linear",
913
+ "final_lr_fraction": 0.1,
914
+ "kind": "linear",
915
+ "warmup_steps": 0,
916
+ "z_loss_coefficient": 0.0
917
+ },
918
+ "recompute_granularity": null,
919
+ "recompute_method": null,
920
+ "recompute_modules": null,
921
+ "recompute_num_layers": null,
922
+ "record_memory_history": false,
923
+ "record_shapes": false,
924
+ "refit_execution_batch_bytes": null,
925
+ "refit_method": "gloo",
926
+ "relative_attention_max_distance": 128,
927
+ "relative_attention_num_buckets": 32,
928
+ "replication": false,
929
+ "replication_factor": 2,
930
+ "replication_jump": null,
931
+ "rerun_mode": "validate_results",
932
+ "reset_attention_mask": false,
933
+ "reset_position_ids": false,
934
+ "result_rejected_tracker_filename": null,
935
+ "retriever_report_topk_accuracies": [],
936
+ "retriever_score_scaling": false,
937
+ "reuse_grad_buf_for_mxfp8_param_ag": false,
938
+ "rl_consumption_granularity": "B",
939
+ "rl_default_temperature": 1.0,
940
+ "rl_default_top_k": -1,
941
+ "rl_default_top_p": 0,
942
+ "rl_durable_rollout_bank": false,
943
+ "rl_generation_lag": null,
944
+ "rl_importance_sampling_truncation_coef": null,
945
+ "rl_inference_expert_model_parallel_size": null,
946
+ "rl_inference_expert_tensor_model_parallel_size": null,
947
+ "rl_inference_logprobs_is_correction": false,
948
+ "rl_inference_model_unified_memory_level": 0,
949
+ "rl_inference_parsers": [],
950
+ "rl_inference_pipeline_model_parallel_size": null,
951
+ "rl_inference_tensor_model_parallel_size": null,
952
+ "rl_kv_cache_management_mode": "persist",
953
+ "rl_max_inflight_requests": null,
954
+ "rl_offload_inference_model_weights_when_idle": false,
955
+ "rl_offload_optimizer_during_inference": false,
956
+ "rl_partial_rollouts": false,
957
+ "rl_persist_cuda_graphs": false,
958
+ "rl_profile": false,
959
+ "rl_profile_dir": null,
960
+ "rl_prompts_per_eval": 32,
961
+ "rl_rollout_bank_dir": null,
962
+ "rl_rollout_bank_max_bytes": 0,
963
+ "rl_sequence_packing_algo": "fifo",
964
+ "rl_sequence_packing_max_sequences_per_bin": 50,
965
+ "rl_skip_bos_token": false,
966
+ "rl_submission_granularity": "B",
967
+ "rl_training_cuda_graphs": false,
968
+ "rl_use_sequence_packing": false,
969
+ "rl_verify_model_weights_swap": false,
970
+ "rope_scaling_factor": 8.0,
971
+ "rope_type": null,
972
+ "rotary_base": 10000,
973
+ "rotary_interleaved": false,
974
+ "rotary_percent": 1.0,
975
+ "rotary_scaling_factor": 1.0,
976
+ "rotary_seq_len_interpolation_factor": null,
977
+ "run_workload_inspector_server": false,
978
+ "sample_rate": 1.0,
979
+ "save": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204652_lookahead-memoryonly-relaunch/checkpoints",
980
+ "save_activations_interval": null,
981
+ "save_dgrads_interval": null,
982
+ "save_interval": 4000,
983
+ "save_params_interval": null,
984
+ "save_retain_interval": 4000,
985
+ "save_tokenizer_assets": true,
986
+ "save_tokens_per_expert_interval": null,
987
+ "save_wgrads_interval": null,
988
+ "seed": 42,
989
+ "seq_length": 2048,
990
+ "sequence_packing_scheduler": null,
991
+ "sequence_parallel": false,
992
+ "sft": false,
993
+ "sft_mock_dataset_config_json": null,
994
+ "sft_tokenizer_prompt_format": "nemotron-h-aligned",
995
+ "sgd_momentum": 0.9,
996
+ "sharp_enabled_group": null,
997
+ "short_seq_prob": 0.1,
998
+ "skip_train": false,
999
+ "skipped_train_samples": 0,
1000
+ "softmax_type": "vanilla",
1001
+ "spec": null,
1002
+ "special_tokens": null,
1003
+ "split": null,
1004
+ "squared_relu": false,
1005
+ "start_eval_at_iter": null,
1006
+ "start_weight_decay": 0.0,
1007
+ "step_batch_size_schedule": null,
1008
+ "straggler_ctrlr_port": 65535,
1009
+ "straggler_minmax_count": 1,
1010
+ "strict_fsdp_dtensor_load": true,
1011
+ "suggested_communication_unit_size": null,
1012
+ "swiglu": false,
1013
+ "swin_backbone_type": "tiny",
1014
+ "symmetric_ar_type": null,
1015
+ "te_precision_config_file": null,
1016
+ "te_rng_tracker": false,
1017
+ "tensor_model_parallel_size": 1,
1018
+ "tensor_parallel_num_weight_shards": 1,
1019
+ "tensorboard_dir": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204652_lookahead-memoryonly-relaunch/tensorboard",
1020
+ "tensorboard_log_interval": 1,
1021
+ "tensorboard_queue_size": 1000,
1022
+ "test_data_path": null,
1023
+ "test_mode": false,
1024
+ "tiktoken_num_special_tokens": 1000,
1025
+ "tiktoken_pattern": null,
1026
+ "timing_log_level": 0,
1027
+ "timing_log_option": "minmax",
1028
+ "titles_data_path": null,
1029
+ "tokenizer_hf_no_include_special_tokens": false,
1030
+ "tokenizer_hf_no_use_fast": false,
1031
+ "tokenizer_model": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/data/tokenizers/paper2604_llama2_32001_3cfa8358de44148a",
1032
+ "tokenizer_sentencepiece_ignore_extra_whitespaces": true,
1033
+ "tokenizer_sentencepiece_legacy": false,
1034
+ "tokenizer_type": "HuggingFaceTokenizer",
1035
+ "torch_fsdp2_reshard_after_forward": true,
1036
+ "tp_comm_bootstrap_backend": "nccl",
1037
+ "tp_comm_bulk_dgrad": true,
1038
+ "tp_comm_bulk_wgrad": true,
1039
+ "tp_comm_overlap": false,
1040
+ "tp_comm_overlap_ag": true,
1041
+ "tp_comm_overlap_cfg": null,
1042
+ "tp_comm_overlap_rs": true,
1043
+ "tp_comm_overlap_rs_dgrad": false,
1044
+ "tp_comm_split_ag": true,
1045
+ "tp_comm_split_rs": true,
1046
+ "train_data_path": null,
1047
+ "train_iters": 26703,
1048
+ "train_samples": null,
1049
+ "train_sync_interval": null,
1050
+ "training_recipe": "paper2604_21106",
1051
+ "training_recipe_metadata": {
1052
+ "assumptions": [],
1053
+ "backend_kernel_assumptions": {},
1054
+ "base_lrs": {
1055
+ "embedding": 0.3,
1056
+ "matrix": 0.014,
1057
+ "norm": 0.005,
1058
+ "other": 0.005,
1059
+ "unembedding": 0.004
1060
+ },
1061
+ "batch_assumptions": {
1062
+ "global_batch_tokens": 262144,
1063
+ "round_up": false,
1064
+ "sequence_length": 2048
1065
+ },
1066
+ "batch_tokens": 262144,
1067
+ "final_lr_fraction": 0.1,
1068
+ "group_weight_decay": {
1069
+ "embedding": 0.0,
1070
+ "matrix": 0.0,
1071
+ "norm": 0.0,
1072
+ "other": 0.0,
1073
+ "unembedding": 0.0
1074
+ },
1075
+ "lr_transfer": "mup_hyperp_released_source",
1076
+ "model": {
1077
+ "activation": "squared_relu",
1078
+ "activation_checkpointing": false,
1079
+ "allow_objective_change_on_resume": false,
1080
+ "attention": "full_causal",
1081
+ "attention_output_gate": false,
1082
+ "backbone_profile": "paper2604_vanilla",
1083
+ "bias": false,
1084
+ "block_application_multiplier": 6.449999999999999,
1085
+ "cache_layer_indices": [
1086
+ 0,
1087
+ 10,
1088
+ 19
1089
+ ],
1090
+ "checkpoint_refiner": false,
1091
+ "crop_padding_before_loss": true,
1092
+ "draft_loss_weight": 0.2,
1093
+ "dropout": 0.0,
1094
+ "execution_architecture": "lookahead",
1095
+ "feedback_loss_weight": 1.0,
1096
+ "ffn_hidden_size": 5632,
1097
+ "future_gradient_mode": "all",
1098
+ "future_loss_weight": 0.2,
1099
+ "head_dim": 128,
1100
+ "hidden_size": 1408,
1101
+ "initialization": {
1102
+ "embedding_normal_std": 1.0,
1103
+ "head_normal_std": 0.001,
1104
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
1105
+ "norm_scale": 1.0
1106
+ },
1107
+ "logit_softcap": 15.0,
1108
+ "lookahead_mode": "parallel",
1109
+ "model_level_norms": [
1110
+ "embedding",
1111
+ "recur",
1112
+ "final"
1113
+ ],
1114
+ "norm_epsilon": 1e-06,
1115
+ "normalize_feedback_embedding": false,
1116
+ "normalize_feedback_output": false,
1117
+ "num_attention_heads": 11,
1118
+ "num_kv_heads": 11,
1119
+ "num_layers": 20,
1120
+ "objective": "lookahead_parallel_next_token",
1121
+ "padded_vocab_size": 32064,
1122
+ "parameter_counts": {
1123
+ "backbone_total_trainable": 566144128,
1124
+ "feedback_parameters": 3964928,
1125
+ "lookahead_parameters": 105083264,
1126
+ "non_embedding_matrix_formula": 475791360,
1127
+ "non_embedding_paper_N": 475851904,
1128
+ "total_parameters": 671227392,
1129
+ "total_trainable": 671227392
1130
+ },
1131
+ "projection_dtype": "bfloat16 (production)",
1132
+ "pseudo_backend": "sdpa_auto",
1133
+ "pseudo_initializer": "A2",
1134
+ "pseudo_temperature": 1.0,
1135
+ "pseudo_top_k": 128,
1136
+ "qk_norm": "functional_rmsnorm_after_rope",
1137
+ "refined_future_loss_weight": 0.0,
1138
+ "refiner_activation": "silu_gated",
1139
+ "refiner_memory": true,
1140
+ "refiner_memory_only": true,
1141
+ "refiner_variant": "R0",
1142
+ "residual_and_norm_scale_dtype": "float32",
1143
+ "residual_multiplier": 1.0,
1144
+ "rope_base": 10000.0,
1145
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
1146
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
1147
+ "tied_embeddings": false,
1148
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
1149
+ "train_passes": 3,
1150
+ "vocab_size": 32001,
1151
+ "width_scale": 22
1152
+ },
1153
+ "optimizer": {
1154
+ "betas": [
1155
+ 0.8,
1156
+ 0.95
1157
+ ],
1158
+ "embedding_lr": 0.3,
1159
+ "eps": 1e-10,
1160
+ "matrix_lr": 0.014,
1161
+ "matrix_weight_decay": 0.0,
1162
+ "max_grad_norm": null,
1163
+ "name": "muonh",
1164
+ "norm_lr": 0.005,
1165
+ "normuon_adjust_lr": "spectral_norm",
1166
+ "normuon_beta2": 0.95,
1167
+ "normuon_momentum": 0.95,
1168
+ "normuon_nesterov": true,
1169
+ "other_lr": 0.005,
1170
+ "scalar_lr": null,
1171
+ "scalar_weight_decay": 0.0,
1172
+ "unembedding_lr": 0.004
1173
+ },
1174
+ "other_parameter_policy": "norm LR (extension for non-paper scalars/biases)",
1175
+ "paper_settings_overridden": false,
1176
+ "peak_lrs": {
1177
+ "embedding": 0.2022599587389726,
1178
+ "matrix": 0.007470638533717786,
1179
+ "norm": 0.00337099931231621,
1180
+ "other": 0.00337099931231621,
1181
+ "unembedding": 0.0026967994498529684
1182
+ },
1183
+ "recipe": "paper2604_21106",
1184
+ "recipe_overrides": {},
1185
+ "reference": "paper vanilla 0-20-0 at width 640; configurable token anchor",
1186
+ "reference_batch_tokens": 262144,
1187
+ "reference_tokens": 983315200,
1188
+ "reference_width": 640,
1189
+ "requested_batch_tokens": 262144,
1190
+ "schedule": {
1191
+ "adamc_weight_decay": false,
1192
+ "cooldown_fraction": 0.0,
1193
+ "cooldown_style": "linear",
1194
+ "final_lr_fraction": 0.1,
1195
+ "kind": "linear",
1196
+ "warmup_steps": 0,
1197
+ "z_loss_coefficient": 0.0
1198
+ },
1199
+ "sequence_length": 2048,
1200
+ "tied_embedding_policy": "unembedding (one AdamW update)",
1201
+ "total_tokens": 7000031232,
1202
+ "warmup_steps": 0,
1203
+ "weight_decay": 0.0,
1204
+ "width": 1408
1205
+ },
1206
+ "transformer_impl": "local",
1207
+ "transformer_pipeline_model_parallel_size": 1,
1208
+ "trust_remote_code": false,
1209
+ "untie_embeddings_and_output_weights": true,
1210
+ "use_checkpoint_args": false,
1211
+ "use_checkpoint_opt_param_scheduler": false,
1212
+ "use_cpu_initialization": null,
1213
+ "use_dist_ckpt": false,
1214
+ "use_dist_ckpt_deprecated": false,
1215
+ "use_distributed_optimizer": false,
1216
+ "use_flash_attn": false,
1217
+ "use_fused_mhc": false,
1218
+ "use_fused_weighted_squared_relu": false,
1219
+ "use_gigatoken": false,
1220
+ "use_gloo_process_groups": true,
1221
+ "use_grouped_gemm_for_dense_mlp": false,
1222
+ "use_grouped_gemm_for_shared_expert": false,
1223
+ "use_kitchen_attention": false,
1224
+ "use_layer_wise_distributed_optimizer": false,
1225
+ "use_layer_wise_param_layout": true,
1226
+ "use_legacy_static_engine": false,
1227
+ "use_mamba_mem_eff_path": true,
1228
+ "use_megatron_fsdp": false,
1229
+ "use_mp_args_from_checkpoint_args": false,
1230
+ "use_mup": false,
1231
+ "use_one_sent_docs": false,
1232
+ "use_persistent_ckpt_worker": false,
1233
+ "use_precision_aware_optimizer": false,
1234
+ "use_pytorch_profiler": false,
1235
+ "use_ring_exchange_p2p": false,
1236
+ "use_rope_scaling": false,
1237
+ "use_rotary_position_embeddings": false,
1238
+ "use_sharp": false,
1239
+ "use_te_activation_func": false,
1240
+ "use_tokenizer_model_from_checkpoint_args": true,
1241
+ "use_torch_fsdp2": false,
1242
+ "use_torch_optimizer_for_cpu_offload": false,
1243
+ "use_tp_pp_dp_mapping": false,
1244
+ "use_transformer_engine_op_fuser": false,
1245
+ "use_varlen_dataset": false,
1246
+ "v_head_dim": 128,
1247
+ "valid_data_path": null,
1248
+ "validation_set_names": null,
1249
+ "variable_seq_lengths": false,
1250
+ "varlen_mock_dataset_config_json": null,
1251
+ "varlen_sbhd_validation": false,
1252
+ "verify_integrity": false,
1253
+ "virtual_pipeline_model_parallel_size": null,
1254
+ "vision_backbone_type": "vit",
1255
+ "vision_pretraining": false,
1256
+ "vision_pretraining_type": "classify",
1257
+ "vocab_extra_ids": 0,
1258
+ "vocab_file": null,
1259
+ "vocab_size": 32001,
1260
+ "wandb_entity": "LoopTF-4-CSPs",
1261
+ "wandb_exp_name": "Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b",
1262
+ "wandb_project": "loopTF-workspace",
1263
+ "wandb_save_dir": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204652_lookahead-memoryonly-relaunch/wandb",
1264
+ "weight_decay": 0.0,
1265
+ "weight_decay_incr_style": "constant",
1266
+ "wgrad_deferral_limit": 0,
1267
+ "window_attn_skip_freq": null,
1268
+ "window_size": null,
1269
+ "world_size": 16,
1270
+ "yaml_cfg": null,
1271
+ "yarn_beta_fast": null,
1272
+ "yarn_beta_slow": null,
1273
+ "yarn_correction_range_round_to_int": null,
1274
+ "yarn_original_max_position_embeddings": null
1275
+ },
1276
+ "model_config": {
1277
+ "attention_dropout": 0.0,
1278
+ "attn_implementation": "sdpa",
1279
+ "backbone_profile": "paper2604_vanilla",
1280
+ "gradient_checkpointing": false,
1281
+ "hf_config_overrides": {},
1282
+ "hidden_size": 1408,
1283
+ "initializer_range": 0.02,
1284
+ "intermediate_size": 5632,
1285
+ "max_position_embeddings": 2048,
1286
+ "model_type": "full_bandwidth",
1287
+ "num_attention_heads": 11,
1288
+ "num_hidden_layers": 20,
1289
+ "num_key_value_heads": 11,
1290
+ "padded_vocab_size": 32064,
1291
+ "paper_full_attention_interval": 6,
1292
+ "paper_sliding_window": 2048,
1293
+ "pretrained_model_name_or_path": null,
1294
+ "revision": null,
1295
+ "rms_norm_eps": 1e-06,
1296
+ "rope_theta": 10000,
1297
+ "tie_word_embeddings": false,
1298
+ "trust_remote_code": false,
1299
+ "vocab_size": 32001
1300
+ },
1301
+ "native_reconstruction": {
1302
+ "active_vocab_size": 32001,
1303
+ "architecture": "lookahead",
1304
+ "attention_backend": "native PyTorch SDPA; Look-ahead backend=sdpa",
1305
+ "ignored_extra_state": [],
1306
+ "max_supported_length": 20480,
1307
+ "model_config": {
1308
+ "attention_dropout": 0.0,
1309
+ "attn_implementation": "sdpa",
1310
+ "backbone_profile": "paper2604_vanilla",
1311
+ "gradient_checkpointing": false,
1312
+ "hf_config_overrides": {},
1313
+ "hidden_size": 1408,
1314
+ "initializer_range": 0.02,
1315
+ "intermediate_size": 5632,
1316
+ "max_position_embeddings": 2048,
1317
+ "model_type": "full_bandwidth",
1318
+ "num_attention_heads": 11,
1319
+ "num_hidden_layers": 20,
1320
+ "num_key_value_heads": 11,
1321
+ "padded_vocab_size": 32064,
1322
+ "paper_full_attention_interval": 6,
1323
+ "paper_sliding_window": 2048,
1324
+ "pretrained_model_name_or_path": null,
1325
+ "revision": null,
1326
+ "rms_norm_eps": 1e-06,
1327
+ "rope_theta": 10000,
1328
+ "tie_word_embeddings": false,
1329
+ "trust_remote_code": false,
1330
+ "vocab_size": 32001
1331
+ },
1332
+ "policy": {
1333
+ "allow_objective_change_on_resume": false,
1334
+ "attention_backend": "sdpa",
1335
+ "cache_layer_indices": null,
1336
+ "checkpoint_refiner": false,
1337
+ "draft_loss_weight": 0.2,
1338
+ "feedback_loss_weight": 1.0,
1339
+ "future_gradient_mode": "all",
1340
+ "future_loss_weight": 0.2,
1341
+ "mode": "parallel",
1342
+ "normalize_feedback_embedding": false,
1343
+ "normalize_feedback_output": false,
1344
+ "num_passes": 3,
1345
+ "pseudo_initializer": "A2",
1346
+ "pseudo_temperature": 1.0,
1347
+ "pseudo_top_k": 128,
1348
+ "refined_future_loss_weight": 0.0,
1349
+ "refiner_gate_bias": -2.0,
1350
+ "refiner_intermediate_size": 5632,
1351
+ "refiner_memory": true,
1352
+ "refiner_memory_only": true,
1353
+ "refiner_variant": "R0"
1354
+ },
1355
+ "prediction": "fixed final-pass full-sequence logits",
1356
+ "step": 26703
1357
+ },
1358
+ "original_training_run_name": "Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b",
1359
+ "parameter_counts": {
1360
+ "backbone_total_trainable": 566144128,
1361
+ "feedback_parameters": 3964928,
1362
+ "lookahead_parameters": 105083264,
1363
+ "non_embedding_matrix_formula": 475791360,
1364
+ "non_embedding_paper_N": 475851904,
1365
+ "total_parameters": 671227392,
1366
+ "total_trainable": 671227392
1367
+ },
1368
+ "pipeline_model_parallel_size": 1,
1369
+ "run_name": "Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci",
1370
+ "source_run_directory": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/output/relaunch/20260921-204652_lookahead-memoryonly-relaunch",
1371
+ "tensor_model_parallel_size": 1,
1372
+ "tokenizer": {
1373
+ "added_tokens": [
1374
+ "<|assistant_end|>"
1375
+ ],
1376
+ "repository": "NousResearch/Llama-2-7b-hf",
1377
+ "repository_or_local_snapshot": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/data/tokenizers/paper2604_llama2_32001_3cfa8358de44148a",
1378
+ "revision": "8efe6c9b93655b934e27bd9981e3ec13e55aee9d"
1379
+ },
1380
+ "training_budget_tokens": 7000031232,
1381
+ "training_code_revision": "7500042108313496c8e252eb2849f87f934c7b8f",
1382
+ "training_tokens": 7000031232,
1383
+ "wandb": {
1384
+ "entity": "LoopTF-4-CSPs",
1385
+ "project": "loopTF-workspace",
1386
+ "run_id": "332i1pci",
1387
+ "run_name": "Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b"
1388
+ }
1389
+ }
Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/launch_config.env ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ # Same Look-ahead recipe; replace the real-bank read by ungated A_new.
2
+ source "$(dirname "${BASH_SOURCE[0]}")/Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemory-7b.env"
3
+ LOOKAHEAD_REFINER_MEMORY_ONLY=true
4
+ RUN_NAME=Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b
5
+ WANDB_TAGS=product,lookahead,paper2604,476m,7b,k3,la2,d0p2,p0p2,f0,a2,r0,refiner_memory_only
Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/manifest.json ADDED
@@ -0,0 +1,25 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "files": {
3
+ "README.md": {
4
+ "sha256": "4505052ae9b75f0d00d10285906eb3a79bea9808ec965bd0753d11dd00f0fc45",
5
+ "size": 581
6
+ },
7
+ "config.json": {
8
+ "sha256": "430687d6edb05e8ed328fa6c4093269d7fb3a6e18b02d3de948815620817ef37",
9
+ "size": 50796
10
+ },
11
+ "launch_config.env": {
12
+ "sha256": "b4cb96d810799641fea03e03bd544efe3d3ce44290919bc2070f5082325d4cf9",
13
+ "size": 376
14
+ },
15
+ "model.safetensors": {
16
+ "sha256": "46f96f614661eab64d84c2a4be97873fae8e7c29b2c7791a07cd91c5266ed58f",
17
+ "size": 1342621344
18
+ },
19
+ "training_recipe.json": {
20
+ "sha256": "deb8b17953a0e3fd07712bf810846a5204df37fdb9f7936d5405c309e42d37d3",
21
+ "size": 4536
22
+ }
23
+ },
24
+ "note": "manifest.json does not hash itself"
25
+ }
Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:46f96f614661eab64d84c2a4be97873fae8e7c29b2c7791a07cd91c5266ed58f
3
+ size 1342621344
Lookahead-K3-LA2-A2-R0-D0p2-P0p2-F0-seed42-refinerMemoryOnly-7b--332i1pci/step_26703/training_recipe.json ADDED
@@ -0,0 +1,155 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "recipe": "paper2604_21106",
3
+ "width": 1408,
4
+ "total_tokens": 7000031232,
5
+ "batch_tokens": 262144,
6
+ "reference_width": 640,
7
+ "reference_tokens": 983315200,
8
+ "reference_batch_tokens": 262144,
9
+ "base_lrs": {
10
+ "matrix": 0.014,
11
+ "embedding": 0.3,
12
+ "unembedding": 0.004,
13
+ "norm": 0.005,
14
+ "other": 0.005
15
+ },
16
+ "peak_lrs": {
17
+ "matrix": 0.007470638533717786,
18
+ "embedding": 0.2022599587389726,
19
+ "unembedding": 0.0026967994498529684,
20
+ "norm": 0.00337099931231621,
21
+ "other": 0.00337099931231621
22
+ },
23
+ "reference": "paper vanilla 0-20-0 at width 640; configurable token anchor",
24
+ "tied_embedding_policy": "unembedding (one AdamW update)",
25
+ "other_parameter_policy": "norm LR (extension for non-paper scalars/biases)",
26
+ "weight_decay": 0.0,
27
+ "warmup_steps": 0,
28
+ "final_lr_fraction": 0.1,
29
+ "optimizer": {
30
+ "name": "muonh",
31
+ "matrix_lr": 0.014,
32
+ "scalar_lr": null,
33
+ "matrix_weight_decay": 0.0,
34
+ "scalar_weight_decay": 0.0,
35
+ "embedding_lr": 0.3,
36
+ "unembedding_lr": 0.004,
37
+ "norm_lr": 0.005,
38
+ "other_lr": 0.005,
39
+ "betas": [
40
+ 0.8,
41
+ 0.95
42
+ ],
43
+ "eps": 1e-10,
44
+ "normuon_momentum": 0.95,
45
+ "normuon_beta2": 0.95,
46
+ "normuon_nesterov": true,
47
+ "normuon_adjust_lr": "spectral_norm",
48
+ "max_grad_norm": null
49
+ },
50
+ "schedule": {
51
+ "kind": "linear",
52
+ "warmup_steps": 0,
53
+ "cooldown_fraction": 0.0,
54
+ "cooldown_style": "linear",
55
+ "final_lr_fraction": 0.1,
56
+ "z_loss_coefficient": 0.0,
57
+ "adamc_weight_decay": false
58
+ },
59
+ "group_weight_decay": {
60
+ "matrix": 0.0,
61
+ "embedding": 0.0,
62
+ "unembedding": 0.0,
63
+ "norm": 0.0,
64
+ "other": 0.0
65
+ },
66
+ "recipe_overrides": {},
67
+ "requested_batch_tokens": 262144,
68
+ "sequence_length": 2048,
69
+ "batch_assumptions": {
70
+ "global_batch_tokens": 262144,
71
+ "sequence_length": 2048,
72
+ "round_up": false
73
+ },
74
+ "lr_transfer": "mup_hyperp_released_source",
75
+ "assumptions": [],
76
+ "backend_kernel_assumptions": {},
77
+ "paper_settings_overridden": false,
78
+ "model": {
79
+ "backbone_profile": "paper2604_vanilla",
80
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
81
+ "width_scale": 22,
82
+ "hidden_size": 1408,
83
+ "num_layers": 20,
84
+ "head_dim": 128,
85
+ "num_attention_heads": 11,
86
+ "num_kv_heads": 11,
87
+ "ffn_hidden_size": 5632,
88
+ "activation": "squared_relu",
89
+ "attention": "full_causal",
90
+ "attention_output_gate": false,
91
+ "qk_norm": "functional_rmsnorm_after_rope",
92
+ "norm_epsilon": 1e-06,
93
+ "model_level_norms": [
94
+ "embedding",
95
+ "recur",
96
+ "final"
97
+ ],
98
+ "rope_base": 10000.0,
99
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
100
+ "bias": false,
101
+ "dropout": 0.0,
102
+ "residual_multiplier": 1.0,
103
+ "residual_and_norm_scale_dtype": "float32",
104
+ "projection_dtype": "bfloat16 (production)",
105
+ "tied_embeddings": false,
106
+ "vocab_size": 32001,
107
+ "padded_vocab_size": 32064,
108
+ "logit_softcap": 15.0,
109
+ "crop_padding_before_loss": true,
110
+ "initialization": {
111
+ "embedding_normal_std": 1.0,
112
+ "head_normal_std": 0.001,
113
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
114
+ "norm_scale": 1.0
115
+ },
116
+ "parameter_counts": {
117
+ "non_embedding_matrix_formula": 475791360,
118
+ "non_embedding_paper_N": 475851904,
119
+ "total_trainable": 671227392,
120
+ "feedback_parameters": 3964928,
121
+ "backbone_total_trainable": 566144128,
122
+ "lookahead_parameters": 105083264,
123
+ "total_parameters": 671227392
124
+ },
125
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
126
+ "execution_architecture": "lookahead",
127
+ "objective": "lookahead_parallel_next_token",
128
+ "lookahead_mode": "parallel",
129
+ "train_passes": 3,
130
+ "feedback_loss_weight": 1.0,
131
+ "cache_layer_indices": [
132
+ 0,
133
+ 10,
134
+ 19
135
+ ],
136
+ "refiner_activation": "silu_gated",
137
+ "pseudo_backend": "sdpa_auto",
138
+ "activation_checkpointing": false,
139
+ "checkpoint_refiner": false,
140
+ "block_application_multiplier": 6.449999999999999,
141
+ "future_loss_weight": 0.2,
142
+ "future_gradient_mode": "all",
143
+ "draft_loss_weight": 0.2,
144
+ "refined_future_loss_weight": 0.0,
145
+ "pseudo_initializer": "A2",
146
+ "pseudo_top_k": 128,
147
+ "pseudo_temperature": 1.0,
148
+ "normalize_feedback_embedding": false,
149
+ "normalize_feedback_output": false,
150
+ "refiner_variant": "R0",
151
+ "refiner_memory": true,
152
+ "refiner_memory_only": true,
153
+ "allow_objective_change_on_resume": false
154
+ }
155
+ }