Siyuc commited on
Commit
cf27dc4
·
verified ·
1 Parent(s): e4c5124

Add Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns step 26703

Browse files

Native weights-only checkpoint export. Source and safetensors were strictly reconstructed and verified locally before upload.

Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/README.md ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ # Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns step 26,703
2
+
3
+ Native weights-only export for Loop K3/L2 with fresh core KV, IFM, terminal adapter, and causal refiner memory. This checkpoint represents 7,000,031,232 consumed input tokens.
4
+
5
+ `model.safetensors` contains the native Megatron model state only. It excludes optimizer, scheduler, RNG, dataloader, datasets, caches, logs, and credentials. It is not a Transformers `AutoModel.from_pretrained` checkpoint.
6
+
7
+ Use the exact training code revision and strict loading instructions in `config.json`. Use `manifest.json` to verify payload hashes.
Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/config.json ADDED
@@ -0,0 +1,1441 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architecture": "full_bandwidth_loop",
3
+ "backbone_profile": "paper2604_vanilla",
4
+ "checkpoint_format": "safetensors_native_megatron_state_dict",
5
+ "checkpoint_version": 3.0,
6
+ "excluded_null_extra_state_keys": [
7
+ "decoder.stack.layers.0.mlp.linear_fc1._extra_state",
8
+ "decoder.stack.layers.0.mlp.linear_fc2._extra_state",
9
+ "decoder.stack.layers.0.self_attention.linear_proj._extra_state",
10
+ "decoder.stack.layers.0.self_attention.linear_qkv._extra_state",
11
+ "decoder.stack.layers.1.mlp.linear_fc1._extra_state",
12
+ "decoder.stack.layers.1.mlp.linear_fc2._extra_state",
13
+ "decoder.stack.layers.1.self_attention.linear_proj._extra_state",
14
+ "decoder.stack.layers.1.self_attention.linear_qkv._extra_state",
15
+ "decoder.stack.layers.10.mlp.linear_fc1._extra_state",
16
+ "decoder.stack.layers.10.mlp.linear_fc2._extra_state",
17
+ "decoder.stack.layers.10.self_attention.linear_proj._extra_state",
18
+ "decoder.stack.layers.10.self_attention.linear_qkv._extra_state",
19
+ "decoder.stack.layers.11.mlp.linear_fc1._extra_state",
20
+ "decoder.stack.layers.11.mlp.linear_fc2._extra_state",
21
+ "decoder.stack.layers.11.self_attention.linear_proj._extra_state",
22
+ "decoder.stack.layers.11.self_attention.linear_qkv._extra_state",
23
+ "decoder.stack.layers.12.mlp.linear_fc1._extra_state",
24
+ "decoder.stack.layers.12.mlp.linear_fc2._extra_state",
25
+ "decoder.stack.layers.12.self_attention.linear_proj._extra_state",
26
+ "decoder.stack.layers.12.self_attention.linear_qkv._extra_state",
27
+ "decoder.stack.layers.13.mlp.linear_fc1._extra_state",
28
+ "decoder.stack.layers.13.mlp.linear_fc2._extra_state",
29
+ "decoder.stack.layers.13.self_attention.linear_proj._extra_state",
30
+ "decoder.stack.layers.13.self_attention.linear_qkv._extra_state",
31
+ "decoder.stack.layers.14.mlp.linear_fc1._extra_state",
32
+ "decoder.stack.layers.14.mlp.linear_fc2._extra_state",
33
+ "decoder.stack.layers.14.self_attention.linear_proj._extra_state",
34
+ "decoder.stack.layers.14.self_attention.linear_qkv._extra_state",
35
+ "decoder.stack.layers.15.mlp.linear_fc1._extra_state",
36
+ "decoder.stack.layers.15.mlp.linear_fc2._extra_state",
37
+ "decoder.stack.layers.15.self_attention.linear_proj._extra_state",
38
+ "decoder.stack.layers.15.self_attention.linear_qkv._extra_state",
39
+ "decoder.stack.layers.16.mlp.linear_fc1._extra_state",
40
+ "decoder.stack.layers.16.mlp.linear_fc2._extra_state",
41
+ "decoder.stack.layers.16.self_attention.linear_proj._extra_state",
42
+ "decoder.stack.layers.16.self_attention.linear_qkv._extra_state",
43
+ "decoder.stack.layers.17.mlp.linear_fc1._extra_state",
44
+ "decoder.stack.layers.17.mlp.linear_fc2._extra_state",
45
+ "decoder.stack.layers.17.self_attention.linear_proj._extra_state",
46
+ "decoder.stack.layers.17.self_attention.linear_qkv._extra_state",
47
+ "decoder.stack.layers.18.mlp.linear_fc1._extra_state",
48
+ "decoder.stack.layers.18.mlp.linear_fc2._extra_state",
49
+ "decoder.stack.layers.18.self_attention.linear_proj._extra_state",
50
+ "decoder.stack.layers.18.self_attention.linear_qkv._extra_state",
51
+ "decoder.stack.layers.19.mlp.linear_fc1._extra_state",
52
+ "decoder.stack.layers.19.mlp.linear_fc2._extra_state",
53
+ "decoder.stack.layers.19.self_attention.linear_proj._extra_state",
54
+ "decoder.stack.layers.19.self_attention.linear_qkv._extra_state",
55
+ "decoder.stack.layers.2.mlp.linear_fc1._extra_state",
56
+ "decoder.stack.layers.2.mlp.linear_fc2._extra_state",
57
+ "decoder.stack.layers.2.self_attention.linear_proj._extra_state",
58
+ "decoder.stack.layers.2.self_attention.linear_qkv._extra_state",
59
+ "decoder.stack.layers.3.mlp.linear_fc1._extra_state",
60
+ "decoder.stack.layers.3.mlp.linear_fc2._extra_state",
61
+ "decoder.stack.layers.3.self_attention.linear_proj._extra_state",
62
+ "decoder.stack.layers.3.self_attention.linear_qkv._extra_state",
63
+ "decoder.stack.layers.4.mlp.linear_fc1._extra_state",
64
+ "decoder.stack.layers.4.mlp.linear_fc2._extra_state",
65
+ "decoder.stack.layers.4.self_attention.linear_proj._extra_state",
66
+ "decoder.stack.layers.4.self_attention.linear_qkv._extra_state",
67
+ "decoder.stack.layers.5.mlp.linear_fc1._extra_state",
68
+ "decoder.stack.layers.5.mlp.linear_fc2._extra_state",
69
+ "decoder.stack.layers.5.self_attention.linear_proj._extra_state",
70
+ "decoder.stack.layers.5.self_attention.linear_qkv._extra_state",
71
+ "decoder.stack.layers.6.mlp.linear_fc1._extra_state",
72
+ "decoder.stack.layers.6.mlp.linear_fc2._extra_state",
73
+ "decoder.stack.layers.6.self_attention.linear_proj._extra_state",
74
+ "decoder.stack.layers.6.self_attention.linear_qkv._extra_state",
75
+ "decoder.stack.layers.7.mlp.linear_fc1._extra_state",
76
+ "decoder.stack.layers.7.mlp.linear_fc2._extra_state",
77
+ "decoder.stack.layers.7.self_attention.linear_proj._extra_state",
78
+ "decoder.stack.layers.7.self_attention.linear_qkv._extra_state",
79
+ "decoder.stack.layers.8.mlp.linear_fc1._extra_state",
80
+ "decoder.stack.layers.8.mlp.linear_fc2._extra_state",
81
+ "decoder.stack.layers.8.self_attention.linear_proj._extra_state",
82
+ "decoder.stack.layers.8.self_attention.linear_qkv._extra_state",
83
+ "decoder.stack.layers.9.mlp.linear_fc1._extra_state",
84
+ "decoder.stack.layers.9.mlp.linear_fc2._extra_state",
85
+ "decoder.stack.layers.9.self_attention.linear_proj._extra_state",
86
+ "decoder.stack.layers.9.self_attention.linear_qkv._extra_state",
87
+ "feedback.state_proj._extra_state",
88
+ "feedback.token_gate_proj._extra_state",
89
+ "output_layer._extra_state"
90
+ ],
91
+ "excluded_state": [
92
+ "optimizer",
93
+ "opt_param_scheduler",
94
+ "rng_state",
95
+ "dataloader"
96
+ ],
97
+ "iteration": 26703,
98
+ "loading": {
99
+ "format": "native Megatron model state saved with safetensors; not a Transformers AutoModel",
100
+ "instructions": "Use loop_transformer_backends.benchmarks.models.build_native with the recorded source revision, or reconstruct the recorded native architecture and load strictly.",
101
+ "key_prefix": null
102
+ },
103
+ "model_arguments": {
104
+ "_is_global_batch_size_explicitly_specified": true,
105
+ "account_for_embedding_in_pipeline_split": false,
106
+ "account_for_loss_in_pipeline_split": false,
107
+ "accumulate_allreduce_grads_in_fp32": true,
108
+ "activation_func_clamp_value": null,
109
+ "activation_offload_fraction": 1.0,
110
+ "adam_beta1": 0.8,
111
+ "adam_beta2": 0.95,
112
+ "adam_eps": 1e-10,
113
+ "adaptive_muon_beta2": 0.95,
114
+ "adaptive_muon_eps": 1e-10,
115
+ "adaptive_muon_moment2_method": "normuon",
116
+ "add_bias_linear": false,
117
+ "add_position_embedding": true,
118
+ "add_qkv_bias": false,
119
+ "adlr_autoresume": false,
120
+ "adlr_autoresume_interval": 1000,
121
+ "align_grad_reduce": true,
122
+ "align_param_gather": false,
123
+ "allow_ambiguous_pad_tokens": false,
124
+ "app_tag_run_name": null,
125
+ "app_tag_run_version": "0.0.0",
126
+ "apply_query_key_layer_scaling": false,
127
+ "apply_residual_connection_post_layernorm": false,
128
+ "apply_rope_fusion": false,
129
+ "apply_wd_to_qk_layernorm": false,
130
+ "architecture": "full_bandwidth_loop",
131
+ "architecture_module": [],
132
+ "async_ckpt_cpu_priority": 10,
133
+ "async_ckpt_io_priority": 3,
134
+ "async_ckpt_use_cpu_shm": false,
135
+ "async_save": false,
136
+ "async_strategy": "mcore",
137
+ "attention_backend": "AttnBackend.auto",
138
+ "attention_cp_layout": "zigzag",
139
+ "attention_dropout": 0.0,
140
+ "attention_output_gate": false,
141
+ "attention_softmax_in_fp32": false,
142
+ "auto_detect_ckpt_format": false,
143
+ "aux_mtp_horizon": 1,
144
+ "aux_mtp_loss_weight": 0.3,
145
+ "aux_mtp_rank": 128,
146
+ "backbone_metadata": {
147
+ "activation": "squared_relu",
148
+ "attention": "full_causal",
149
+ "attention_output_gate": false,
150
+ "backbone_profile": "paper2604_vanilla",
151
+ "bias": false,
152
+ "block_application_multiplier": 6.449999999999999,
153
+ "block_application_multiplier_per_pass": 2.15,
154
+ "crop_padding_before_loss": true,
155
+ "depth_kv_policy": "recompute_each_loop",
156
+ "depth_num_loops": 2,
157
+ "depth_share_kv": false,
158
+ "dropout": 0.0,
159
+ "eval_passes": 3,
160
+ "execution_architecture": "full_bandwidth_loop",
161
+ "feedback_enabled": true,
162
+ "feedback_pass_mixture": {
163
+ "3": 1.0
164
+ },
165
+ "feedback_progressive_stages": [],
166
+ "ffn_hidden_size": 5632,
167
+ "head_dim": 128,
168
+ "hidden_size": 1408,
169
+ "initialization": {
170
+ "embedding_normal_std": 1.0,
171
+ "head_normal_std": 0.001,
172
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
173
+ "norm_scale": 1.0
174
+ },
175
+ "logical_layers_per_pass": 40,
176
+ "logit_softcap": 15.0,
177
+ "loop_adapter": {
178
+ "after_depth_loop": 2,
179
+ "applications_per_pass": 1,
180
+ "attention_backend": "sdpa_auto",
181
+ "bank_layers": [
182
+ 0,
183
+ 10,
184
+ 19
185
+ ],
186
+ "bank_source": "first depth loop, fresh on each feedback pass",
187
+ "checkpoint_refiner": false,
188
+ "ffn_size": 5632,
189
+ "memory_source": "each adapter block's input states; fresh each feedback pass",
190
+ "real_bank_read": true,
191
+ "refiner_memory": true,
192
+ "refiner_memory_only": false,
193
+ "state_input": "second-loop hidden states after norm_recur and norm_final",
194
+ "terminal_norms": true,
195
+ "weight_sharing": "one adapter shared across feedback passes"
196
+ },
197
+ "loop_final_adapter": "lookahead_refiner",
198
+ "loop_input_write": "ifm_diagonal",
199
+ "loop_input_write_init": "paper_matrix; a=b_delta=0; alpha=0.5; delta=log(2)",
200
+ "loop_input_write_placement": "before_every_depth_loop_after_initial_norm_emb",
201
+ "loop_input_write_sharing": "all_depth_loops_and_outer_feedback_passes",
202
+ "loop_input_write_source": "raw_token_embeddings",
203
+ "model_level_norms": [
204
+ "embedding",
205
+ "recur",
206
+ "final"
207
+ ],
208
+ "norm_epsilon": 1e-06,
209
+ "norm_placement": "embedding once; recur/final after loop 2 before three refiners; no post-refiner norm",
210
+ "num_attention_heads": 11,
211
+ "num_kv_heads": 11,
212
+ "num_layers": 20,
213
+ "objective": "latent_feedback_causal_lm",
214
+ "padded_vocab_size": 32064,
215
+ "parameter_counts": {
216
+ "feedback_parameters": 3967744,
217
+ "loop_adapter_parameters": 95166723,
218
+ "loop_input_write_parameters": 1985280,
219
+ "non_embedding_matrix_formula": 475791360,
220
+ "non_embedding_paper_N": 475851904,
221
+ "total_trainable": 667263875
222
+ },
223
+ "projection_dtype": "bfloat16 (production)",
224
+ "qk_norm": "functional_rmsnorm_after_rope",
225
+ "residual_and_norm_scale_dtype": "float32",
226
+ "residual_multiplier": 1.0,
227
+ "rope_base": 10000.0,
228
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
229
+ "shared_layer_weights": true,
230
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
231
+ "tied_embeddings": false,
232
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
233
+ "train_passes": 3,
234
+ "vocab_size": 32001,
235
+ "width_scale": 22
236
+ },
237
+ "backbone_profile": "paper2604_vanilla",
238
+ "barrier_with_L1_time": true,
239
+ "batch_invariant_backend": "te_native",
240
+ "batch_invariant_collective": "ordered",
241
+ "batch_invariant_mode": false,
242
+ "bert_binary_head": true,
243
+ "bert_embedder_type": "megatron",
244
+ "bert_load": null,
245
+ "bf16": true,
246
+ "bias_dropout_fusion": false,
247
+ "bias_gelu_fusion": false,
248
+ "bias_swiglu_fusion": true,
249
+ "biencoder_projection_dim": 0,
250
+ "biencoder_shared_query_context_model": false,
251
+ "block_data_path": null,
252
+ "cache_mla_latents": false,
253
+ "calc_ft_timeouts": false,
254
+ "calculate_per_token_loss": false,
255
+ "chat_template": null,
256
+ "check_for_large_grads": false,
257
+ "check_for_nan_in_loss_and_grad": true,
258
+ "check_for_spiky_loss": false,
259
+ "check_weight_hash_across_dp_replicas_interval": null,
260
+ "ckpt_assume_constant_structure": false,
261
+ "ckpt_convert_format": null,
262
+ "ckpt_convert_save": null,
263
+ "ckpt_convert_update_legacy_dist_opt_format": false,
264
+ "ckpt_drop_redundant_extra_state": false,
265
+ "ckpt_format": "torch",
266
+ "ckpt_fully_parallel_load": false,
267
+ "ckpt_fully_parallel_load_exchange_algo": "broadcast",
268
+ "ckpt_fully_parallel_load_per_rank_objects": false,
269
+ "ckpt_fully_parallel_load_process_group": "dp",
270
+ "ckpt_fully_parallel_save": true,
271
+ "ckpt_fully_parallel_save_deprecated": false,
272
+ "ckpt_fully_parallel_save_process_group": "dp",
273
+ "ckpt_load_validate_sharding_integrity": true,
274
+ "ckpt_pg_tensors_cache_create": false,
275
+ "ckpt_pg_tensors_cache_path": null,
276
+ "ckpt_step": null,
277
+ "classes_fraction": 1.0,
278
+ "clip_grad": 0.0,
279
+ "clone_scatter_output_in_embedding": true,
280
+ "config_logger_dir": "",
281
+ "consumed_train_samples": 3417984,
282
+ "consumed_valid_samples": 68608,
283
+ "context_parallel_size": 1,
284
+ "cp_comm_type": [
285
+ "p2p"
286
+ ],
287
+ "cpu_offloading_num_layers": 0,
288
+ "cpu_offloading_retain_pinned_cpu_buffers": false,
289
+ "create_all_gather_group": false,
290
+ "create_attention_mask_in_dataloader": false,
291
+ "cross_entropy_fusion_impl": "native",
292
+ "cross_entropy_loss_fusion": false,
293
+ "csa_compress_ratios": null,
294
+ "csa_compress_rotary_base": 40000.0,
295
+ "csa_dense_mode": false,
296
+ "csa_window_size": 128,
297
+ "cuda_graph_impl": "none",
298
+ "cuda_graph_modules": [],
299
+ "cuda_graph_warmup_steps": 3,
300
+ "curr_iteration": 26702,
301
+ "data_args_path": null,
302
+ "data_cache_path": null,
303
+ "data_parallel_random_init": false,
304
+ "data_parallel_sharding_strategy": "optim_grads_params",
305
+ "data_parallel_size": 16,
306
+ "data_path": null,
307
+ "data_per_class_fraction": 1.0,
308
+ "data_sharding": true,
309
+ "dataloader_defer_npy_index_mmap": false,
310
+ "dataloader_fast_cache_load": false,
311
+ "dataloader_inter_document_masking": false,
312
+ "dataloader_save": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204653_loop-dual-relaunch/dataloader",
313
+ "dataloader_type": "external",
314
+ "ddp_average_in_collective": false,
315
+ "ddp_bucket_size": null,
316
+ "ddp_num_buckets": null,
317
+ "ddp_pad_buckets_for_high_nccl_busbw": false,
318
+ "ddp_param_name_patterns_for_fp32_local_accumulation": [],
319
+ "ddp_reduce_scatter_with_fp32_accumulation": false,
320
+ "decode_only_cuda_graphs": false,
321
+ "decoder_first_pipeline_num_layers": null,
322
+ "decoder_last_pipeline_num_layers": null,
323
+ "decoder_num_layers": null,
324
+ "decoder_seq_length": null,
325
+ "decoupled_lr": null,
326
+ "decoupled_min_lr": null,
327
+ "decrease_batch_size_if_needed": false,
328
+ "defer_embedding_wgrad_compute": false,
329
+ "delay_offload_until_cuda_graph": false,
330
+ "delay_wgrad_compute": false,
331
+ "delta_offload_bytes_across_pp_ranks": 0,
332
+ "deprecated_use_mcore_models": false,
333
+ "depth_num_loops": 2,
334
+ "depth_share_kv": false,
335
+ "deterministic_mode": false,
336
+ "dino_bottleneck_size": 256,
337
+ "dino_freeze_last_layer": 1,
338
+ "dino_head_hidden_size": 2048,
339
+ "dino_local_crops_number": 10,
340
+ "dino_local_img_size": 96,
341
+ "dino_norm_last_layer": false,
342
+ "dino_teacher_temp": 0.07,
343
+ "dino_warmup_teacher_temp": 0.04,
344
+ "dino_warmup_teacher_temp_epochs": 30,
345
+ "disable_bf16_reduced_precision_matmul": false,
346
+ "disable_jit_fuser": false,
347
+ "disable_msc_deprecated": false,
348
+ "disable_straggler_on_startup": false,
349
+ "disable_symmetric_registration": false,
350
+ "dist_ckpt_format_deprecated": null,
351
+ "dist_ckpt_optim_fully_reshardable": false,
352
+ "dist_ckpt_save_pre_mcore_014": false,
353
+ "dist_ckpt_strictness": "assume_ok_unexpected",
354
+ "dist_ckpt_workers": 1,
355
+ "distrib_optim_fully_reshardable_mem_efficient": false,
356
+ "distribute_saved_activations": false,
357
+ "distributed_backend": "nccl",
358
+ "distributed_timeout_minutes": 10,
359
+ "distributed_timeout_seconds_after_init": null,
360
+ "do_test": 0,
361
+ "do_train": 1,
362
+ "do_valid": 1,
363
+ "dsa_indexer_head_dim": null,
364
+ "dsa_indexer_k_norm_epsilon": null,
365
+ "dsa_indexer_k_norm_fp32": false,
366
+ "dsa_indexer_loss_coeff": null,
367
+ "dsa_indexer_n_heads": null,
368
+ "dsa_indexer_rope_interleaved": false,
369
+ "dsa_indexer_rotate_activation": true,
370
+ "dsa_indexer_scoring_relu": true,
371
+ "dsa_indexer_skip_topk_offset": 0,
372
+ "dsa_indexer_topk": null,
373
+ "dsa_indexer_topk_freq": 1,
374
+ "dsa_indexer_use_sparse_loss": false,
375
+ "dsa_kernel_backend": "none",
376
+ "dump_param_to_param_group_map": null,
377
+ "embedding_init_method_std": null,
378
+ "embedding_path": null,
379
+ "empty_unused_memory_level": 0,
380
+ "enable_chunked_prefill": false,
381
+ "enable_cuda_graph": false,
382
+ "enable_experimental": false,
383
+ "enable_ft_package": false,
384
+ "enable_full_sharding_in_hsdp": false,
385
+ "enable_mhc_connections": false,
386
+ "enable_msc": false,
387
+ "enable_one_logger": true,
388
+ "encoder_num_layers": 20,
389
+ "encoder_seq_length": 2048,
390
+ "end_weight_decay": 0.0,
391
+ "eod_mask_loss": false,
392
+ "ep_overlap_early_attn_memory_release": false,
393
+ "error_injection_rate": 0,
394
+ "error_injection_type": "transient_error",
395
+ "eval_at_start": true,
396
+ "eval_global_batch_size": 128,
397
+ "eval_interval": 100,
398
+ "eval_iters": 2,
399
+ "eval_micro_batch_size": 8,
400
+ "evaluation_metadata": {
401
+ "eval_at_start": true,
402
+ "final_validation_input_tokens": 70778880,
403
+ "final_validation_iters": 270,
404
+ "final_validation_sequences": 34560,
405
+ "global_batch_size": 128,
406
+ "initial_iters": 2,
407
+ "intermediate_input_tokens": 524288,
408
+ "intermediate_iters": 2,
409
+ "sequence_length": 2048,
410
+ "test_iters": 0,
411
+ "validation_iterator": "continues_existing_held_out_iterator"
412
+ },
413
+ "evidence_data_path": null,
414
+ "exit_duration_in_mins": null,
415
+ "exit_interval": null,
416
+ "exit_on_missing_checkpoint": false,
417
+ "exit_signal": 15,
418
+ "exit_signal_handler": false,
419
+ "exit_signal_handler_for_dataloader": false,
420
+ "exit_signal_handler_for_training": false,
421
+ "exp_avg_dtype": "torch.float32",
422
+ "exp_avg_sq_dtype": "torch.float32",
423
+ "experimental_attention_variant": null,
424
+ "expert_data_parallel_sharding_strategy": null,
425
+ "expert_gtp_weight_remat_size": 1,
426
+ "expert_model_parallel_size": 1,
427
+ "expert_tensor_parallel_num_weight_shards": 1,
428
+ "expert_tensor_parallel_size": 1,
429
+ "external_cuda_graph": false,
430
+ "fake_process_group": false,
431
+ "fault_injector_delay_start_iteration": null,
432
+ "fault_injector_fault_delay": null,
433
+ "fault_injector_fault_probabilities": null,
434
+ "fault_injector_fault_types": null,
435
+ "fault_injector_mtti_seconds": null,
436
+ "fault_injector_num_ranks": null,
437
+ "fault_injector_offset_seconds": null,
438
+ "fault_injector_ranks": null,
439
+ "fault_injector_seed": null,
440
+ "feedback_eval_passes": 3,
441
+ "feedback_jitter_sigma": 0.0,
442
+ "feedback_layers": null,
443
+ "feedback_log_hidden_change": false,
444
+ "feedback_loss_weight": 1.0,
445
+ "feedback_normuon_beta2": 0.95,
446
+ "feedback_pass_mixture": "3:1.0",
447
+ "feedback_prefix_mixin": false,
448
+ "feedback_progressive_stages": "[]",
449
+ "feedback_scalar_lr": 0.0005,
450
+ "feedback_scalar_weight_decay": 0.0,
451
+ "feedback_z_loss_coefficient": 0.0,
452
+ "feedback_z_loss_start_fraction": 1.0,
453
+ "ffn_hidden_size": 5632,
454
+ "fim_data": false,
455
+ "fim_eod_token": "<|endoftext|>",
456
+ "fim_fragment_rate": null,
457
+ "fim_middle_token": "<fim_middle>",
458
+ "fim_no_prefix": null,
459
+ "fim_pad_token": "<fim_pad>",
460
+ "fim_prefix_token": "<fim_prefix>",
461
+ "fim_rate": 0.5,
462
+ "fim_split_sample": null,
463
+ "fim_spm_rate": 0.5,
464
+ "fim_suffix_token": "<fim_suffix>",
465
+ "final_eval_iters": 270,
466
+ "fine_grained_activation_offloading": false,
467
+ "fine_grained_offloading_max_inflight_offloads": null,
468
+ "finetune": false,
469
+ "first_last_layers_bf16": false,
470
+ "flash_attention_version": null,
471
+ "flash_decode": false,
472
+ "flight_recorder_dump_on_timeout": true,
473
+ "flight_recorder_dump_path": null,
474
+ "flight_recorder_extra_dump_on_exec": true,
475
+ "flight_recorder_include_only_active": true,
476
+ "flight_recorder_include_stack_trace": false,
477
+ "flight_recorder_trace_buffer_size": 2000,
478
+ "fp16": false,
479
+ "fp16_lm_cross_entropy": false,
480
+ "fp32_residual_connection": false,
481
+ "fp4": null,
482
+ "fp4_param_gather": false,
483
+ "fp4_quantizer_factory": null,
484
+ "fp4_recipe": "nvfp4",
485
+ "fp8": null,
486
+ "fp8_amax_compute_algo": "most_recent",
487
+ "fp8_amax_history_len": 1,
488
+ "fp8_interval": 1,
489
+ "fp8_margin": 0,
490
+ "fp8_output_proj": false,
491
+ "fp8_param_gather": false,
492
+ "fp8_quantizer_factory": null,
493
+ "fp8_recipe": "delayed",
494
+ "fp8_wgrad": true,
495
+ "freeze_all_layers": false,
496
+ "fsdp_db_use_persist_buf_on_alloc_fail": false,
497
+ "fsdp_double_buffer": false,
498
+ "fsdp_manual_registration": false,
499
+ "ft_num_warmup_iters": 5,
500
+ "full_validation": false,
501
+ "fused_residual_rmsnorm": false,
502
+ "gdp_cutedsl_kernel": false,
503
+ "gdp_num_chunk_states_to_recompute": 2,
504
+ "gdp_num_householder": 3,
505
+ "global_batch_size": 128,
506
+ "glu_linear_offset": 0.0,
507
+ "gpu_sniff_test_interval": null,
508
+ "grad_reduce_in_bf16": false,
509
+ "gradient_accumulation_fusion": false,
510
+ "gradient_reduce_div_fusion": true,
511
+ "group_query_attention": false,
512
+ "grpo_clamp_eps_lower": 0.01,
513
+ "grpo_clamp_eps_upper": 0.01,
514
+ "grpo_entropy_term_weight": 0.0,
515
+ "grpo_filter_groups_with_same_reward": false,
516
+ "grpo_group_size": 2,
517
+ "grpo_iterations": 2,
518
+ "grpo_kl_beta": 0.001,
519
+ "grpo_prompts_per_step": 32,
520
+ "gtp_expert_remat_nccl_ub": false,
521
+ "gtp_remat_nccl_ub": false,
522
+ "gtp_remat_opt_in_modules": [],
523
+ "gtp_remat_reduce_scatter_with_fp32_accumulation": false,
524
+ "gtp_weight_remat_size": 1,
525
+ "head_lr_mult": 1.0,
526
+ "heterogeneous_layers_config_encoded_json": null,
527
+ "heterogeneous_layers_config_path": null,
528
+ "hfsdp_param_gather_overlap": false,
529
+ "hidden_dropout": 0.0,
530
+ "hidden_size": 1408,
531
+ "hierarchical_context_parallel_sizes": null,
532
+ "high_priority_a2a_comm_stream": false,
533
+ "high_priority_stream_groups": [],
534
+ "hybrid_context_parallel": false,
535
+ "hybrid_layer_pattern": null,
536
+ "hybrid_override_pattern": null,
537
+ "hysteresis": 2,
538
+ "ict_head_size": null,
539
+ "ict_load": null,
540
+ "img_h": 224,
541
+ "img_w": 224,
542
+ "indexer_batch_size": 128,
543
+ "indexer_log_interval": 1000,
544
+ "inference_batch_times_seqlen_threshold": -1,
545
+ "inference_coordinator_port": null,
546
+ "inference_cuda_graph_all_prefills": false,
547
+ "inference_cuda_graph_max_tokens": 512,
548
+ "inference_cuda_graph_scope": "InferenceCudaGraphScope.none",
549
+ "inference_disable_ep_consensus": false,
550
+ "inference_disable_triton_nvls_kernels": false,
551
+ "inference_dynamic_batching": false,
552
+ "inference_dynamic_batching_allow_stale_multimodal_embeddings": false,
553
+ "inference_dynamic_batching_async_sched_mode": "async",
554
+ "inference_dynamic_batching_block_size": 256,
555
+ "inference_dynamic_batching_buffer_size_gb": 40.0,
556
+ "inference_dynamic_batching_cuda_graph_mixed_prefill_count": 16,
557
+ "inference_dynamic_batching_cuda_graph_sizing_distribution": "hybrid",
558
+ "inference_dynamic_batching_enable_prefix_caching": false,
559
+ "inference_dynamic_batching_logprobs_mode": "raw_logprobs",
560
+ "inference_dynamic_batching_mamba_memory_ratio": null,
561
+ "inference_dynamic_batching_max_requests": null,
562
+ "inference_dynamic_batching_max_tokens": null,
563
+ "inference_dynamic_batching_media_cache_coordinator_policy": "affinity",
564
+ "inference_dynamic_batching_media_cache_routing_weight": 1.0,
565
+ "inference_dynamic_batching_num_cuda_graphs": 16,
566
+ "inference_dynamic_batching_paused_buffer_size_gb": null,
567
+ "inference_dynamic_batching_prefix_cache_ttl_seconds": 300.0,
568
+ "inference_dynamic_batching_prefix_caching_coordinator_policy": "longest_prefix",
569
+ "inference_dynamic_batching_prefix_caching_eviction_policy": "lru",
570
+ "inference_dynamic_batching_prefix_caching_mamba_gb": null,
571
+ "inference_dynamic_batching_prefix_caching_routing_alpha": 1.0,
572
+ "inference_dynamic_batching_sampling_backend": "torch",
573
+ "inference_dynamic_batching_track_generated_token_events": false,
574
+ "inference_dynamic_batching_track_paused_request_events": false,
575
+ "inference_dynamic_batching_unified_memory_level": 0,
576
+ "inference_dynamic_batching_vision_embedding_cache_max_bytes": 0,
577
+ "inference_flashinfer_mxfp8_token_capacity": null,
578
+ "inference_fuse_tp_communication": false,
579
+ "inference_grouped_gemm_backend": "vllm",
580
+ "inference_logging_step_interval": 0,
581
+ "inference_max_requests": 8,
582
+ "inference_max_seq_length": 2560,
583
+ "inference_moe_disable_fused_quant_kernels": false,
584
+ "inference_moe_token_dispatcher_type": "nvls",
585
+ "inference_rng_tracker": false,
586
+ "inference_shards": null,
587
+ "inference_text_gen_server_logging": false,
588
+ "inference_use_synchronous_zmq_collectives": false,
589
+ "inference_wandb_logging": false,
590
+ "init_method_std": 0.02,
591
+ "init_method_xavier_uniform": false,
592
+ "init_model_with_meta_device": false,
593
+ "initial_loss_scale": 4294967296,
594
+ "inprocess_active_world_size": 16,
595
+ "inprocess_barrier_timeout": 120,
596
+ "inprocess_completion_timeout": 120,
597
+ "inprocess_empty_cuda_cache": false,
598
+ "inprocess_granularity": "node",
599
+ "inprocess_hard_timeout": 90,
600
+ "inprocess_heartbeat_interval": 30,
601
+ "inprocess_heartbeat_timeout": 60,
602
+ "inprocess_last_call_wait": 1,
603
+ "inprocess_max_iterations": null,
604
+ "inprocess_monitor_process_interval": 1.0,
605
+ "inprocess_monitor_thread_interval": 1.0,
606
+ "inprocess_progress_watchdog_interval": 1.0,
607
+ "inprocess_restart": false,
608
+ "inprocess_soft_timeout": 60,
609
+ "inprocess_termination_grace_time": 1,
610
+ "is_hybrid_model": false,
611
+ "iter_per_epoch": 1250,
612
+ "iteration": 0,
613
+ "iterations_to_skip": [],
614
+ "keep_fp8_transpose_cache": false,
615
+ "kitchen_attention_backend": "sdpa",
616
+ "kv_channels": 128,
617
+ "kv_lora_rank": 32,
618
+ "langrl_env_config": null,
619
+ "layernorm_epsilon": 1e-06,
620
+ "layernorm_zero_centered_gamma": false,
621
+ "lazy_mpu_init": false,
622
+ "linear_attention_freq": null,
623
+ "linear_conv_kernel_dim": 4,
624
+ "linear_cp_layout": "zigzag",
625
+ "linear_cp_mode": "headwise",
626
+ "linear_key_head_dim": 128,
627
+ "linear_num_key_heads": 16,
628
+ "linear_num_value_heads": 32,
629
+ "linear_value_head_dim": 128,
630
+ "lion_beta1": 0.95,
631
+ "lion_beta2": 0.98,
632
+ "load": null,
633
+ "load_main_params_from_ckpt": false,
634
+ "local_rank": 0,
635
+ "log_device_memory_used": false,
636
+ "log_energy": false,
637
+ "log_interval": 1,
638
+ "log_loss_scale_to_tensorboard": true,
639
+ "log_max_attention_logit": false,
640
+ "log_memory_interval": null,
641
+ "log_memory_to_tensorboard": false,
642
+ "log_num_zeros_in_grad": false,
643
+ "log_params_norm": false,
644
+ "log_progress": false,
645
+ "log_straggler": false,
646
+ "log_throughput": false,
647
+ "log_timers_to_tensorboard": true,
648
+ "log_validation_ppl_to_tensorboard": false,
649
+ "log_world_size_to_tensorboard": false,
650
+ "logging_level": null,
651
+ "logit_dtype": null,
652
+ "logits_load_decode_threads": 4,
653
+ "logits_load_dir": null,
654
+ "logits_load_ignore_errors": false,
655
+ "logits_load_kd_loss_alpha": 1.0,
656
+ "logits_load_msc_prefetch_depth": 2,
657
+ "logits_load_prefetch_factor": 3,
658
+ "logits_save_dir": null,
659
+ "logits_save_dtype": "fp16",
660
+ "logits_save_top_k": null,
661
+ "logits_save_top_p": null,
662
+ "logits_save_top_p_min_k": 1,
663
+ "loop_adapter_attention_backend": "sdpa_auto",
664
+ "loop_adapter_checkpoint_refiner": false,
665
+ "loop_adapter_ffn_size": 5632,
666
+ "loop_adapter_refiner_memory": true,
667
+ "loop_adapter_refiner_memory_only": false,
668
+ "loop_final_adapter": "lookahead_refiner",
669
+ "loop_input_write": "ifm_diagonal",
670
+ "loss_scale": null,
671
+ "loss_scale_window": 1000,
672
+ "lr": 0.007470638533717786,
673
+ "lr_decay_iters": null,
674
+ "lr_decay_samples": null,
675
+ "lr_decay_style": "linear",
676
+ "lr_warmup_fraction": null,
677
+ "lr_warmup_init": 0.0,
678
+ "lr_warmup_iters": 0,
679
+ "lr_warmup_samples": 0,
680
+ "lr_wsd_decay_iters": 0,
681
+ "lr_wsd_decay_samples": null,
682
+ "lr_wsd_decay_style": "linear",
683
+ "main_grads_dtype": "torch.float32",
684
+ "main_params_dtype": "torch.float32",
685
+ "make_vocab_size_divisible_by": 64,
686
+ "mamba_head_dim": 64,
687
+ "mamba_inference_conv_states_dtype": "torch.bfloat16",
688
+ "mamba_inference_ssm_states_dtype": "torch.bfloat16",
689
+ "mamba_num_groups": 8,
690
+ "mamba_num_heads": null,
691
+ "mamba_state_dim": 128,
692
+ "mamba_training_ssm_states_dtype": null,
693
+ "manual_gc": false,
694
+ "manual_gc_eval": true,
695
+ "manual_gc_interval": 0,
696
+ "mask_factor": 1.0,
697
+ "mask_prob": 0.15,
698
+ "mask_type": "random",
699
+ "masked_softmax_fusion": true,
700
+ "max_position_embeddings": 2048,
701
+ "max_seqlen_per_dp_cp_rank": null,
702
+ "max_tokens_to_oom": 12000,
703
+ "megatron_fsdp_enable_fine_grained_param_gather": false,
704
+ "megatron_fsdp_grad_comm_dtype": null,
705
+ "megatron_fsdp_main_grads_dtype": null,
706
+ "megatron_fsdp_main_params_dtype": "torch.float32",
707
+ "megatron_fsdp_max_pool_double_buffer": false,
708
+ "megatron_fsdp_version": 1,
709
+ "megatron_lm_path": "/root/dl/runtime/Megatron-LM",
710
+ "memory_snapshot_path": "snapshot.pickle",
711
+ "merge_file": null,
712
+ "metadata_path": null,
713
+ "mhc_fused_backend": "auto",
714
+ "mhc_init_gating_factor": 0.01,
715
+ "mhc_num_residual_streams": 4,
716
+ "mhc_recompute_layer_num": null,
717
+ "mhc_sinkhorn_iterations": 20,
718
+ "micro_batch_size": 8,
719
+ "microbatch_group_size_per_vp_stage": null,
720
+ "mid_level_dataset_surplus": 0.005,
721
+ "min_loss_scale": 1.0,
722
+ "min_lr": 0.0007470638533717787,
723
+ "min_offloaded_tensor_size": 1048576,
724
+ "mla_down_proj_fusion": false,
725
+ "mlp_chunks_for_prefill": 1,
726
+ "mlp_chunks_for_training": 1,
727
+ "mmap_bin_files": true,
728
+ "mock_data": false,
729
+ "moe_apply_probs_on_input": false,
730
+ "moe_aux_loss_coeff": 0.0,
731
+ "moe_combine_bwd_dtype": "bf16",
732
+ "moe_deepep_num_sms": null,
733
+ "moe_dispatch_fwd_dtype": "bf16",
734
+ "moe_enable_deepep": false,
735
+ "moe_enable_routing_replay": false,
736
+ "moe_expert_capacity_factor": null,
737
+ "moe_expert_rank_capacity_factor": null,
738
+ "moe_ffn_hidden_size": null,
739
+ "moe_flex_dispatcher_backend": "deepep",
740
+ "moe_flex_dispatcher_num_sms": null,
741
+ "moe_grouped_gemm": false,
742
+ "moe_hybridep_num_blocks_permute": null,
743
+ "moe_hybridep_num_blocks_unpermute": null,
744
+ "moe_hybridep_num_sms": null,
745
+ "moe_hybridep_num_sms_preprocessing": 108,
746
+ "moe_hybridep_pad_uneven_dispatch_inputs": false,
747
+ "moe_input_jitter_eps": null,
748
+ "moe_latent_size": null,
749
+ "moe_layer_freq": 1,
750
+ "moe_layer_recompute": false,
751
+ "moe_mlp_glu_interleave_size": null,
752
+ "moe_ncclep_zero_copy": false,
753
+ "moe_pad_expert_input_to_capacity": false,
754
+ "moe_pad_experts_for_cuda_graph_inference": false,
755
+ "moe_paged_stash": false,
756
+ "moe_paged_stash_buffer_size_factor_cpu": 0.0,
757
+ "moe_paged_stash_buffer_size_factor_cuda": 1.1,
758
+ "moe_paged_stash_page_size": 64,
759
+ "moe_per_layer_logging": false,
760
+ "moe_permute_fusion": false,
761
+ "moe_permute_fusion_into_hybridep": false,
762
+ "moe_router_bias_update_rate": 0.001,
763
+ "moe_router_dtype": null,
764
+ "moe_router_enable_expert_bias": false,
765
+ "moe_router_force_biased": null,
766
+ "moe_router_force_load_balancing": false,
767
+ "moe_router_fusion": false,
768
+ "moe_router_group_topk": null,
769
+ "moe_router_load_balancing_type": "aux_loss",
770
+ "moe_router_num_groups": null,
771
+ "moe_router_padding_for_fp8": false,
772
+ "moe_router_padding_for_quantization": false,
773
+ "moe_router_pre_softmax": false,
774
+ "moe_router_quantile_balancing_ema": 0.0,
775
+ "moe_router_score_function": "softmax",
776
+ "moe_router_skip_muon": false,
777
+ "moe_router_topk": 2,
778
+ "moe_router_topk_scaling_factor": null,
779
+ "moe_routing_trace_capture_hidden_states": false,
780
+ "moe_routing_trace_capture_logits": false,
781
+ "moe_routing_trace_dump_weights": false,
782
+ "moe_routing_trace_max_training_iters": null,
783
+ "moe_routing_trace_path": null,
784
+ "moe_shared_expert_gate": false,
785
+ "moe_shared_expert_glu_interleave_size": null,
786
+ "moe_shared_expert_intermediate_size": null,
787
+ "moe_shared_expert_overlap": false,
788
+ "moe_single_grouped_bias": false,
789
+ "moe_single_grouped_weight": false,
790
+ "moe_token_dispatcher_type": "allgather",
791
+ "moe_token_drop_policy": "probs",
792
+ "moe_upcycling_granularity": 1,
793
+ "moe_use_grouped_tensor": false,
794
+ "moe_use_norm_before_up_proj": false,
795
+ "moe_use_upcycling": false,
796
+ "moe_z_loss_coeff": null,
797
+ "mrope_section": null,
798
+ "mscale": 1.0,
799
+ "mscale_all_dim": 0.0,
800
+ "mtp_detach_heads": false,
801
+ "mtp_hsm": false,
802
+ "mtp_hybrid_override_pattern": null,
803
+ "mtp_loss_scaling_factor": 0.1,
804
+ "mtp_num_layers": null,
805
+ "mtp_standalone": false,
806
+ "mtp_use_repeated_layer": false,
807
+ "multi_latent_attention": false,
808
+ "multiple_validation_sets": false,
809
+ "muon_coefficient_type": "quintic",
810
+ "muon_extra_scale_factor": 1.0,
811
+ "muon_fp32_matmul_prec": "medium",
812
+ "muon_momentum": 0.95,
813
+ "muon_nesterov": true,
814
+ "muon_num_ns_steps": 5,
815
+ "muon_scalar_optimizer": "adam",
816
+ "muon_scale_mode": "spectral",
817
+ "muon_split_qkv": true,
818
+ "muon_tp_mode": "duplicated",
819
+ "muon_use_syrk": false,
820
+ "mup_attn_scale_power": 1.0,
821
+ "mup_base_head_dim": null,
822
+ "mup_base_hidden_size": null,
823
+ "mup_embedding_mult": 1.0,
824
+ "mup_output_mult": 1.0,
825
+ "mup_width_mult": 1.0,
826
+ "nccl_all_reduce_for_prefill": false,
827
+ "nccl_communicator_config_path": null,
828
+ "nccl_ub": false,
829
+ "no_load_optim": null,
830
+ "no_load_rng": null,
831
+ "no_persist_layer_norm": false,
832
+ "no_rope_freq": null,
833
+ "no_save_optim": null,
834
+ "no_save_rng": null,
835
+ "no_weight_decay_cond_type": null,
836
+ "non_persistent_ckpt_type": null,
837
+ "non_persistent_global_ckpt_dir": null,
838
+ "non_persistent_local_ckpt_algo": "fully_parallel",
839
+ "non_persistent_local_ckpt_dir": null,
840
+ "non_persistent_save_interval": null,
841
+ "normalization": "RMSNorm",
842
+ "null_tokenizer_eod_id": null,
843
+ "null_tokenizer_pad_id": -1,
844
+ "num_attention_heads": 11,
845
+ "num_channels": 3,
846
+ "num_classes": 1000,
847
+ "num_dataset_builder_threads": 1,
848
+ "num_distributed_optimizer_instances": 1,
849
+ "num_experts": null,
850
+ "num_floating_point_operations_so_far": 0,
851
+ "num_layers": 20,
852
+ "num_layers_at_end_in_bf16": 1,
853
+ "num_layers_at_start_in_bf16": 1,
854
+ "num_layers_per_virtual_pipeline_stage": null,
855
+ "num_query_groups": 11,
856
+ "num_speculative_tokens": 0,
857
+ "num_virtual_stages_per_pipeline_rank": null,
858
+ "num_workers": 0,
859
+ "nvtx_ranges": false,
860
+ "object_storage_cache_path": null,
861
+ "offload_modules": [],
862
+ "offset_sampling_seed_by_dp_rank": true,
863
+ "one_logger_async": false,
864
+ "one_logger_project": "megatron-lm",
865
+ "one_logger_run_name": null,
866
+ "online_data": true,
867
+ "online_data_cache_dir": "/root/dl/runtime/script/loopTF-workspace/data/cache/huggingface",
868
+ "online_dataset": "HuggingFaceFW/fineweb-edu",
869
+ "online_dataset_revision": "87f09149ef4734204d70ed1d046ddc9ca3f2b8f9",
870
+ "online_dataset_subset": "sample-100BT",
871
+ "online_latency_log_dir": null,
872
+ "online_pack_sequences": false,
873
+ "online_prefetch_batches": 16,
874
+ "online_raw_manifest": null,
875
+ "online_shuffle_buffer_records": 128,
876
+ "online_source_mode": "stream",
877
+ "online_source_split": "train",
878
+ "online_split_seed": 260421106,
879
+ "online_text_column": "text",
880
+ "online_tokenizer_batch_size": 256,
881
+ "online_tokenizer_revision": "8efe6c9b93655b934e27bd9981e3ec13e55aee9d",
882
+ "online_validation_fraction": 0.001,
883
+ "online_validation_manifest": "/root/dl/runtime/script/loopTF-workspace/data/validation/manual_14b/manifest.json",
884
+ "onnx_safe": null,
885
+ "openai_gelu": false,
886
+ "optimizer": "muonh",
887
+ "optimizer_cpu_offload": false,
888
+ "optimizer_cuda_graph": false,
889
+ "optimizer_offload_fraction": 1.0,
890
+ "otel_enabled": false,
891
+ "otel_service_name": null,
892
+ "otel_span_groups": null,
893
+ "outer_dp_sharding_strategy": "no_shard",
894
+ "output_bert_embeddings": false,
895
+ "overlap_cpu_optimizer_d2h_h2d": false,
896
+ "overlap_dispatch_backward_with_experts_wgrad": false,
897
+ "overlap_grad_reduce": false,
898
+ "overlap_moe_expert_parallel_comm": false,
899
+ "overlap_p2p_comm": false,
900
+ "overlap_p2p_comm_warmup_flush": false,
901
+ "overlap_param_gather": false,
902
+ "overlap_param_gather_with_optimizer_step": false,
903
+ "override_ckpt_iteration": null,
904
+ "override_opt_param_scheduler": false,
905
+ "pad_vocab_size": true,
906
+ "padded_vocab_size": 32064,
907
+ "paper_base_matrix_lr": 0.014,
908
+ "paper_embedding_lr": 0.3,
909
+ "paper_norm_lr": 0.005,
910
+ "paper_other_lr": 0.005,
911
+ "paper_reference_batch_tokens": 262144,
912
+ "paper_reference_tokens": 983315200,
913
+ "paper_reference_width": 640,
914
+ "paper_transfer": {
915
+ "batch_tokens": 262144,
916
+ "reference_batch_tokens": 262144,
917
+ "reference_tokens": 983315200,
918
+ "reference_width": 640,
919
+ "total_tokens": 7000031232,
920
+ "width": 1408
921
+ },
922
+ "paper_unembedding_lr": 0.004,
923
+ "params_dtype": "torch.bfloat16",
924
+ "patch_dim": 16,
925
+ "per_dataset_sequences_path": null,
926
+ "per_split_data_args_path": null,
927
+ "perform_initialization": true,
928
+ "perform_rl_step": false,
929
+ "phase_transition_iterations": null,
930
+ "pin_cpu_grads": true,
931
+ "pin_cpu_params": true,
932
+ "pipeline_model_parallel_comm_backend": null,
933
+ "pipeline_model_parallel_layout": null,
934
+ "pipeline_model_parallel_size": 1,
935
+ "position_embedding_type": "rope",
936
+ "pretrained_checkpoint": null,
937
+ "profile": false,
938
+ "profile_ranks": [],
939
+ "profile_step_end": 12,
940
+ "profile_step_start": 10,
941
+ "pytorch_profiler_collect_callstack": false,
942
+ "pytorch_profiler_collect_chakra": false,
943
+ "pytorch_profiler_collect_shapes": false,
944
+ "q_lora_rank": null,
945
+ "qk_clip": false,
946
+ "qk_clip_alpha": 0.5,
947
+ "qk_clip_threshold": 100,
948
+ "qk_head_dim": 128,
949
+ "qk_l2_norm": false,
950
+ "qk_layernorm": false,
951
+ "qk_pos_emb_head_dim": 64,
952
+ "query_in_block_prob": 0.1,
953
+ "quick_geglu": false,
954
+ "rampup_batch_size": null,
955
+ "rank": 0,
956
+ "recipe_optimizer": {
957
+ "betas": [
958
+ 0.8,
959
+ 0.95
960
+ ],
961
+ "embedding_lr": 0.3,
962
+ "eps": 1e-10,
963
+ "matrix_lr": 0.014,
964
+ "matrix_weight_decay": 0.0,
965
+ "max_grad_norm": null,
966
+ "name": "muonh",
967
+ "norm_lr": 0.005,
968
+ "normuon_adjust_lr": "spectral_norm",
969
+ "normuon_beta2": 0.95,
970
+ "normuon_momentum": 0.95,
971
+ "normuon_nesterov": true,
972
+ "other_lr": 0.005,
973
+ "scalar_lr": null,
974
+ "scalar_weight_decay": 0.0,
975
+ "unembedding_lr": 0.004
976
+ },
977
+ "recipe_overrides": {},
978
+ "recipe_requested_batch_tokens": 262144,
979
+ "recipe_schedule": {
980
+ "adamc_weight_decay": false,
981
+ "cooldown_fraction": 0.0,
982
+ "cooldown_style": "linear",
983
+ "final_lr_fraction": 0.1,
984
+ "kind": "linear",
985
+ "warmup_steps": 0,
986
+ "z_loss_coefficient": 0.0
987
+ },
988
+ "recompute_granularity": null,
989
+ "recompute_method": null,
990
+ "recompute_modules": null,
991
+ "recompute_num_layers": null,
992
+ "record_memory_history": false,
993
+ "record_shapes": false,
994
+ "refit_execution_batch_bytes": null,
995
+ "refit_method": "gloo",
996
+ "relative_attention_max_distance": 128,
997
+ "relative_attention_num_buckets": 32,
998
+ "replication": false,
999
+ "replication_factor": 2,
1000
+ "replication_jump": null,
1001
+ "rerun_mode": "validate_results",
1002
+ "reset_attention_mask": false,
1003
+ "reset_position_ids": false,
1004
+ "result_rejected_tracker_filename": null,
1005
+ "retriever_report_topk_accuracies": [],
1006
+ "retriever_score_scaling": false,
1007
+ "reuse_grad_buf_for_mxfp8_param_ag": false,
1008
+ "rl_consumption_granularity": "B",
1009
+ "rl_default_temperature": 1.0,
1010
+ "rl_default_top_k": -1,
1011
+ "rl_default_top_p": 0,
1012
+ "rl_durable_rollout_bank": false,
1013
+ "rl_generation_lag": null,
1014
+ "rl_importance_sampling_truncation_coef": null,
1015
+ "rl_inference_expert_model_parallel_size": null,
1016
+ "rl_inference_expert_tensor_model_parallel_size": null,
1017
+ "rl_inference_logprobs_is_correction": false,
1018
+ "rl_inference_model_unified_memory_level": 0,
1019
+ "rl_inference_parsers": [],
1020
+ "rl_inference_pipeline_model_parallel_size": null,
1021
+ "rl_inference_tensor_model_parallel_size": null,
1022
+ "rl_kv_cache_management_mode": "persist",
1023
+ "rl_max_inflight_requests": null,
1024
+ "rl_offload_inference_model_weights_when_idle": false,
1025
+ "rl_offload_optimizer_during_inference": false,
1026
+ "rl_partial_rollouts": false,
1027
+ "rl_persist_cuda_graphs": false,
1028
+ "rl_profile": false,
1029
+ "rl_profile_dir": null,
1030
+ "rl_prompts_per_eval": 32,
1031
+ "rl_rollout_bank_dir": null,
1032
+ "rl_rollout_bank_max_bytes": 0,
1033
+ "rl_sequence_packing_algo": "fifo",
1034
+ "rl_sequence_packing_max_sequences_per_bin": 50,
1035
+ "rl_skip_bos_token": false,
1036
+ "rl_submission_granularity": "B",
1037
+ "rl_training_cuda_graphs": false,
1038
+ "rl_use_sequence_packing": false,
1039
+ "rl_verify_model_weights_swap": false,
1040
+ "rope_scaling_factor": 8.0,
1041
+ "rope_type": null,
1042
+ "rotary_base": 10000,
1043
+ "rotary_interleaved": false,
1044
+ "rotary_percent": 1.0,
1045
+ "rotary_scaling_factor": 1.0,
1046
+ "rotary_seq_len_interpolation_factor": null,
1047
+ "run_workload_inspector_server": false,
1048
+ "sample_rate": 1.0,
1049
+ "save": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204653_loop-dual-relaunch/checkpoints",
1050
+ "save_activations_interval": null,
1051
+ "save_dgrads_interval": null,
1052
+ "save_interval": 4000,
1053
+ "save_params_interval": null,
1054
+ "save_retain_interval": 4000,
1055
+ "save_tokenizer_assets": true,
1056
+ "save_tokens_per_expert_interval": null,
1057
+ "save_wgrads_interval": null,
1058
+ "seed": 42,
1059
+ "seq_length": 2048,
1060
+ "sequence_packing_scheduler": null,
1061
+ "sequence_parallel": false,
1062
+ "sft": false,
1063
+ "sft_mock_dataset_config_json": null,
1064
+ "sft_tokenizer_prompt_format": "nemotron-h-aligned",
1065
+ "sgd_momentum": 0.9,
1066
+ "sharp_enabled_group": null,
1067
+ "short_seq_prob": 0.1,
1068
+ "skip_train": false,
1069
+ "skipped_train_samples": 0,
1070
+ "softmax_type": "vanilla",
1071
+ "spec": null,
1072
+ "special_tokens": null,
1073
+ "split": null,
1074
+ "squared_relu": false,
1075
+ "start_eval_at_iter": null,
1076
+ "start_weight_decay": 0.0,
1077
+ "step_batch_size_schedule": null,
1078
+ "straggler_ctrlr_port": 65535,
1079
+ "straggler_minmax_count": 1,
1080
+ "strict_fsdp_dtensor_load": true,
1081
+ "suggested_communication_unit_size": null,
1082
+ "swiglu": false,
1083
+ "swin_backbone_type": "tiny",
1084
+ "symmetric_ar_type": null,
1085
+ "te_precision_config_file": null,
1086
+ "te_rng_tracker": false,
1087
+ "tensor_model_parallel_size": 1,
1088
+ "tensor_parallel_num_weight_shards": 1,
1089
+ "tensorboard_dir": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204653_loop-dual-relaunch/tensorboard",
1090
+ "tensorboard_log_interval": 1,
1091
+ "tensorboard_queue_size": 1000,
1092
+ "test_data_path": null,
1093
+ "test_mode": false,
1094
+ "tiktoken_num_special_tokens": 1000,
1095
+ "tiktoken_pattern": null,
1096
+ "timing_log_level": 0,
1097
+ "timing_log_option": "minmax",
1098
+ "titles_data_path": null,
1099
+ "tokenizer_hf_no_include_special_tokens": false,
1100
+ "tokenizer_hf_no_use_fast": false,
1101
+ "tokenizer_model": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/data/tokenizers/paper2604_llama2_32001_3cfa8358de44148a",
1102
+ "tokenizer_sentencepiece_ignore_extra_whitespaces": true,
1103
+ "tokenizer_sentencepiece_legacy": false,
1104
+ "tokenizer_type": "HuggingFaceTokenizer",
1105
+ "torch_fsdp2_reshard_after_forward": true,
1106
+ "tp_comm_bootstrap_backend": "nccl",
1107
+ "tp_comm_bulk_dgrad": true,
1108
+ "tp_comm_bulk_wgrad": true,
1109
+ "tp_comm_overlap": false,
1110
+ "tp_comm_overlap_ag": true,
1111
+ "tp_comm_overlap_cfg": null,
1112
+ "tp_comm_overlap_rs": true,
1113
+ "tp_comm_overlap_rs_dgrad": false,
1114
+ "tp_comm_split_ag": true,
1115
+ "tp_comm_split_rs": true,
1116
+ "train_data_path": null,
1117
+ "train_iters": 26703,
1118
+ "train_samples": null,
1119
+ "train_sync_interval": null,
1120
+ "training_recipe": "paper2604_21106",
1121
+ "training_recipe_metadata": {
1122
+ "assumptions": [],
1123
+ "backend_kernel_assumptions": {},
1124
+ "base_lrs": {
1125
+ "embedding": 0.3,
1126
+ "matrix": 0.014,
1127
+ "norm": 0.005,
1128
+ "other": 0.005,
1129
+ "unembedding": 0.004
1130
+ },
1131
+ "batch_assumptions": {
1132
+ "global_batch_tokens": 262144,
1133
+ "round_up": false,
1134
+ "sequence_length": 2048
1135
+ },
1136
+ "batch_tokens": 262144,
1137
+ "final_lr_fraction": 0.1,
1138
+ "group_weight_decay": {
1139
+ "embedding": 0.0,
1140
+ "matrix": 0.0,
1141
+ "norm": 0.0,
1142
+ "other": 0.0,
1143
+ "unembedding": 0.0
1144
+ },
1145
+ "lr_transfer": "mup_hyperp_released_source",
1146
+ "model": {
1147
+ "activation": "squared_relu",
1148
+ "attention": "full_causal",
1149
+ "attention_output_gate": false,
1150
+ "backbone_profile": "paper2604_vanilla",
1151
+ "bias": false,
1152
+ "block_application_multiplier": 6.449999999999999,
1153
+ "block_application_multiplier_per_pass": 2.15,
1154
+ "crop_padding_before_loss": true,
1155
+ "depth_kv_policy": "recompute_each_loop",
1156
+ "depth_num_loops": 2,
1157
+ "depth_share_kv": false,
1158
+ "dropout": 0.0,
1159
+ "eval_passes": 3,
1160
+ "execution_architecture": "full_bandwidth_loop",
1161
+ "feedback_enabled": true,
1162
+ "feedback_pass_mixture": {
1163
+ "3": 1.0
1164
+ },
1165
+ "feedback_progressive_stages": [],
1166
+ "ffn_hidden_size": 5632,
1167
+ "head_dim": 128,
1168
+ "hidden_size": 1408,
1169
+ "initialization": {
1170
+ "embedding_normal_std": 1.0,
1171
+ "head_normal_std": 0.001,
1172
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
1173
+ "norm_scale": 1.0
1174
+ },
1175
+ "logical_layers_per_pass": 40,
1176
+ "logit_softcap": 15.0,
1177
+ "loop_adapter": {
1178
+ "after_depth_loop": 2,
1179
+ "applications_per_pass": 1,
1180
+ "attention_backend": "sdpa_auto",
1181
+ "bank_layers": [
1182
+ 0,
1183
+ 10,
1184
+ 19
1185
+ ],
1186
+ "bank_source": "first depth loop, fresh on each feedback pass",
1187
+ "checkpoint_refiner": false,
1188
+ "ffn_size": 5632,
1189
+ "memory_source": "each adapter block's input states; fresh each feedback pass",
1190
+ "real_bank_read": true,
1191
+ "refiner_memory": true,
1192
+ "refiner_memory_only": false,
1193
+ "state_input": "second-loop hidden states after norm_recur and norm_final",
1194
+ "terminal_norms": true,
1195
+ "weight_sharing": "one adapter shared across feedback passes"
1196
+ },
1197
+ "loop_final_adapter": "lookahead_refiner",
1198
+ "loop_input_write": "ifm_diagonal",
1199
+ "loop_input_write_init": "paper_matrix; a=b_delta=0; alpha=0.5; delta=log(2)",
1200
+ "loop_input_write_placement": "before_every_depth_loop_after_initial_norm_emb",
1201
+ "loop_input_write_sharing": "all_depth_loops_and_outer_feedback_passes",
1202
+ "loop_input_write_source": "raw_token_embeddings",
1203
+ "model_level_norms": [
1204
+ "embedding",
1205
+ "recur",
1206
+ "final"
1207
+ ],
1208
+ "norm_epsilon": 1e-06,
1209
+ "norm_placement": "embedding once; recur/final after loop 2 before three refiners; no post-refiner norm",
1210
+ "num_attention_heads": 11,
1211
+ "num_kv_heads": 11,
1212
+ "num_layers": 20,
1213
+ "objective": "latent_feedback_causal_lm",
1214
+ "padded_vocab_size": 32064,
1215
+ "parameter_counts": {
1216
+ "feedback_parameters": 3967744,
1217
+ "loop_adapter_parameters": 95166723,
1218
+ "loop_input_write_parameters": 1985280,
1219
+ "non_embedding_matrix_formula": 475791360,
1220
+ "non_embedding_paper_N": 475851904,
1221
+ "total_trainable": 667263875
1222
+ },
1223
+ "projection_dtype": "bfloat16 (production)",
1224
+ "qk_norm": "functional_rmsnorm_after_rope",
1225
+ "residual_and_norm_scale_dtype": "float32",
1226
+ "residual_multiplier": 1.0,
1227
+ "rope_base": 10000.0,
1228
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
1229
+ "shared_layer_weights": true,
1230
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
1231
+ "tied_embeddings": false,
1232
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
1233
+ "train_passes": 3,
1234
+ "vocab_size": 32001,
1235
+ "width_scale": 22
1236
+ },
1237
+ "optimizer": {
1238
+ "betas": [
1239
+ 0.8,
1240
+ 0.95
1241
+ ],
1242
+ "embedding_lr": 0.3,
1243
+ "eps": 1e-10,
1244
+ "matrix_lr": 0.014,
1245
+ "matrix_weight_decay": 0.0,
1246
+ "max_grad_norm": null,
1247
+ "name": "muonh",
1248
+ "norm_lr": 0.005,
1249
+ "normuon_adjust_lr": "spectral_norm",
1250
+ "normuon_beta2": 0.95,
1251
+ "normuon_momentum": 0.95,
1252
+ "normuon_nesterov": true,
1253
+ "other_lr": 0.005,
1254
+ "scalar_lr": null,
1255
+ "scalar_weight_decay": 0.0,
1256
+ "unembedding_lr": 0.004
1257
+ },
1258
+ "other_parameter_policy": "norm LR (extension for non-paper scalars/biases)",
1259
+ "paper_settings_overridden": false,
1260
+ "peak_lrs": {
1261
+ "embedding": 0.2022599587389726,
1262
+ "matrix": 0.007470638533717786,
1263
+ "norm": 0.00337099931231621,
1264
+ "other": 0.00337099931231621,
1265
+ "unembedding": 0.0026967994498529684
1266
+ },
1267
+ "recipe": "paper2604_21106",
1268
+ "recipe_overrides": {},
1269
+ "reference": "paper vanilla 0-20-0 at width 640; configurable token anchor",
1270
+ "reference_batch_tokens": 262144,
1271
+ "reference_tokens": 983315200,
1272
+ "reference_width": 640,
1273
+ "requested_batch_tokens": 262144,
1274
+ "schedule": {
1275
+ "adamc_weight_decay": false,
1276
+ "cooldown_fraction": 0.0,
1277
+ "cooldown_style": "linear",
1278
+ "final_lr_fraction": 0.1,
1279
+ "kind": "linear",
1280
+ "warmup_steps": 0,
1281
+ "z_loss_coefficient": 0.0
1282
+ },
1283
+ "sequence_length": 2048,
1284
+ "tied_embedding_policy": "unembedding (one AdamW update)",
1285
+ "total_tokens": 7000031232,
1286
+ "warmup_steps": 0,
1287
+ "weight_decay": 0.0,
1288
+ "width": 1408
1289
+ },
1290
+ "transformer_impl": "local",
1291
+ "transformer_pipeline_model_parallel_size": 1,
1292
+ "trust_remote_code": false,
1293
+ "untie_embeddings_and_output_weights": true,
1294
+ "use_checkpoint_args": false,
1295
+ "use_checkpoint_opt_param_scheduler": false,
1296
+ "use_cpu_initialization": null,
1297
+ "use_dist_ckpt": false,
1298
+ "use_dist_ckpt_deprecated": false,
1299
+ "use_distributed_optimizer": false,
1300
+ "use_flash_attn": false,
1301
+ "use_fused_mhc": false,
1302
+ "use_fused_weighted_squared_relu": false,
1303
+ "use_gigatoken": false,
1304
+ "use_gloo_process_groups": true,
1305
+ "use_grouped_gemm_for_dense_mlp": false,
1306
+ "use_grouped_gemm_for_shared_expert": false,
1307
+ "use_kitchen_attention": false,
1308
+ "use_layer_wise_distributed_optimizer": false,
1309
+ "use_layer_wise_param_layout": true,
1310
+ "use_legacy_static_engine": false,
1311
+ "use_mamba_mem_eff_path": true,
1312
+ "use_megatron_fsdp": false,
1313
+ "use_mp_args_from_checkpoint_args": false,
1314
+ "use_mup": false,
1315
+ "use_one_sent_docs": false,
1316
+ "use_persistent_ckpt_worker": false,
1317
+ "use_precision_aware_optimizer": false,
1318
+ "use_pytorch_profiler": false,
1319
+ "use_ring_exchange_p2p": false,
1320
+ "use_rope_scaling": false,
1321
+ "use_rotary_position_embeddings": false,
1322
+ "use_sharp": false,
1323
+ "use_te_activation_func": false,
1324
+ "use_tokenizer_model_from_checkpoint_args": true,
1325
+ "use_torch_fsdp2": false,
1326
+ "use_torch_optimizer_for_cpu_offload": false,
1327
+ "use_tp_pp_dp_mapping": false,
1328
+ "use_transformer_engine_op_fuser": false,
1329
+ "use_varlen_dataset": false,
1330
+ "v_head_dim": 128,
1331
+ "valid_data_path": null,
1332
+ "validation_set_names": null,
1333
+ "variable_seq_lengths": false,
1334
+ "varlen_mock_dataset_config_json": null,
1335
+ "varlen_sbhd_validation": false,
1336
+ "verify_integrity": false,
1337
+ "virtual_pipeline_model_parallel_size": null,
1338
+ "vision_backbone_type": "vit",
1339
+ "vision_pretraining": false,
1340
+ "vision_pretraining_type": "classify",
1341
+ "vocab_extra_ids": 0,
1342
+ "vocab_file": null,
1343
+ "vocab_size": 32001,
1344
+ "wandb_entity": "LoopTF-4-CSPs",
1345
+ "wandb_exp_name": "Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory",
1346
+ "wandb_project": "loopTF-workspace",
1347
+ "wandb_save_dir": "/root/dl/runtime/script/loopTF-workspace/output/relaunch/20260921-204653_loop-dual-relaunch/wandb",
1348
+ "weight_decay": 0.0,
1349
+ "weight_decay_incr_style": "constant",
1350
+ "wgrad_deferral_limit": 0,
1351
+ "window_attn_skip_freq": null,
1352
+ "window_size": null,
1353
+ "world_size": 16,
1354
+ "yaml_cfg": null,
1355
+ "yarn_beta_fast": null,
1356
+ "yarn_beta_slow": null,
1357
+ "yarn_correction_range_round_to_int": null,
1358
+ "yarn_original_max_position_embeddings": null
1359
+ },
1360
+ "native_reconstruction": {
1361
+ "active_vocab_size": 32001,
1362
+ "architecture": "full_bandwidth_loop",
1363
+ "context_extension": "native RoPE, no scaling; at most 2x training length",
1364
+ "max_supported_length": 4096,
1365
+ "model_config": {
1366
+ "attention_dropout": 0.0,
1367
+ "attn_implementation": "sdpa",
1368
+ "backbone_profile": "paper2604_vanilla",
1369
+ "gradient_checkpointing": false,
1370
+ "hf_config_overrides": {},
1371
+ "hidden_size": 1408,
1372
+ "initializer_range": 0.02,
1373
+ "intermediate_size": 5632,
1374
+ "max_position_embeddings": 2048,
1375
+ "model_type": "full_bandwidth",
1376
+ "num_attention_heads": 11,
1377
+ "num_hidden_layers": 20,
1378
+ "num_key_value_heads": 11,
1379
+ "padded_vocab_size": 32064,
1380
+ "paper_full_attention_interval": 6,
1381
+ "paper_sliding_window": 0,
1382
+ "pretrained_model_name_or_path": null,
1383
+ "revision": null,
1384
+ "rms_norm_eps": 1e-06,
1385
+ "rope_theta": 10000,
1386
+ "tie_word_embeddings": false,
1387
+ "trust_remote_code": false,
1388
+ "vocab_size": 32001
1389
+ },
1390
+ "policy": {
1391
+ "depth_loops": 2,
1392
+ "depth_share_kv": false,
1393
+ "feedback_layers": [
1394
+ 20
1395
+ ],
1396
+ "final_adapter": {
1397
+ "attention_backend": "sdpa_auto",
1398
+ "checkpoint_refiner": false,
1399
+ "ffn_size": 5632,
1400
+ "kind": "lookahead_refiner",
1401
+ "refiner_memory": true,
1402
+ "refiner_memory_only": false
1403
+ },
1404
+ "loop_input_write": "ifm_diagonal",
1405
+ "num_passes": 3
1406
+ },
1407
+ "prediction": "fixed final feedback-pass logits; eval jitter/prefix mixin disabled",
1408
+ "step": 26703,
1409
+ "training_context_length": 2048
1410
+ },
1411
+ "original_training_run_name": "Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory",
1412
+ "parameter_counts": {
1413
+ "feedback_parameters": 3967744,
1414
+ "loop_adapter_parameters": 95166723,
1415
+ "loop_input_write_parameters": 1985280,
1416
+ "non_embedding_matrix_formula": 475791360,
1417
+ "non_embedding_paper_N": 475851904,
1418
+ "total_trainable": 667263875
1419
+ },
1420
+ "pipeline_model_parallel_size": 1,
1421
+ "run_name": "Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns",
1422
+ "source_run_directory": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/output/relaunch/20260921-204653_loop-dual-relaunch",
1423
+ "tensor_model_parallel_size": 1,
1424
+ "tokenizer": {
1425
+ "added_tokens": [
1426
+ "<|assistant_end|>"
1427
+ ],
1428
+ "repository": "NousResearch/Llama-2-7b-hf",
1429
+ "repository_or_local_snapshot": "/taijifs_wzbi/rentTest/hunyuan/kenanchen/loopTF-workspace/data/tokenizers/paper2604_llama2_32001_3cfa8358de44148a",
1430
+ "revision": "8efe6c9b93655b934e27bd9981e3ec13e55aee9d"
1431
+ },
1432
+ "training_budget_tokens": 7000031232,
1433
+ "training_code_revision": "7500042108313496c8e252eb2849f87f934c7b8f",
1434
+ "training_tokens": 7000031232,
1435
+ "wandb": {
1436
+ "entity": "LoopTF-4-CSPs",
1437
+ "project": "loopTF-workspace",
1438
+ "run_id": "djl7i6ns",
1439
+ "run_name": "Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory"
1440
+ }
1441
+ }
Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/launch_config.env ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ # Retain the 95815z5f recipe with fresh backbone KV on every inner depth loop.
2
+ # All three terminal adapter blocks also build their own fresh KV.
3
+ source "$(dirname "${BASH_SOURCE[0]}")/476M_7b_FBW0_K3_L2_ADAPTER_IFM.env"
4
+ LOOP_ADAPTER_REFINER_MEMORY=true
5
+ LOOP_ADAPTER_REFINER_MEMORY_ONLY=false
6
+ RUN_NAME=Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory
7
+ WANDB_RUN_GROUP=causal_refiner_memory_476m_7b
8
+ WANDB_TAGS=product,loop,loop2,paper2604,476m,7b,k3,lookahead_refiner,ifm_diagonal,freshkv,refiner_memory
Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/manifest.json ADDED
@@ -0,0 +1,25 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "files": {
3
+ "README.md": {
4
+ "sha256": "2701316998090f6fe755922ac57e00bf47020bc77958a487c68dfa009fa7a129",
5
+ "size": 625
6
+ },
7
+ "config.json": {
8
+ "sha256": "8c28175797a89b530124e4e0243d716a329c7a19bbdfae7d828ea9cbd3ffe801",
9
+ "size": 55535
10
+ },
11
+ "launch_config.env": {
12
+ "sha256": "c9abee3f4a4f27497c8d174d53e6ac110fe114cb367c841bf6598de0209a55ee",
13
+ "size": 518
14
+ },
15
+ "model.safetensors": {
16
+ "sha256": "fdda1cf96e4e87d4924ec723e222dad86bb7f32a43a1f530c5be959ae70e6b38",
17
+ "size": 1334685190
18
+ },
19
+ "training_recipe.json": {
20
+ "sha256": "48ec955426c5734d8ef5f759fc35592a4ddf64202cf9d251f12b8bdcb066a23e",
21
+ "size": 5337
22
+ }
23
+ },
24
+ "note": "manifest.json does not hash itself"
25
+ }
Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fdda1cf96e4e87d4924ec723e222dad86bb7f32a43a1f530c5be959ae70e6b38
3
+ size 1334685190
Loop-K3-L2-KVFresh-Adapter3-NormOn-IFMOn-seed42-7b-refinerMemory--djl7i6ns/step_26703/training_recipe.json ADDED
@@ -0,0 +1,169 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "recipe": "paper2604_21106",
3
+ "width": 1408,
4
+ "total_tokens": 7000031232,
5
+ "batch_tokens": 262144,
6
+ "reference_width": 640,
7
+ "reference_tokens": 983315200,
8
+ "reference_batch_tokens": 262144,
9
+ "base_lrs": {
10
+ "matrix": 0.014,
11
+ "embedding": 0.3,
12
+ "unembedding": 0.004,
13
+ "norm": 0.005,
14
+ "other": 0.005
15
+ },
16
+ "peak_lrs": {
17
+ "matrix": 0.007470638533717786,
18
+ "embedding": 0.2022599587389726,
19
+ "unembedding": 0.0026967994498529684,
20
+ "norm": 0.00337099931231621,
21
+ "other": 0.00337099931231621
22
+ },
23
+ "reference": "paper vanilla 0-20-0 at width 640; configurable token anchor",
24
+ "tied_embedding_policy": "unembedding (one AdamW update)",
25
+ "other_parameter_policy": "norm LR (extension for non-paper scalars/biases)",
26
+ "weight_decay": 0.0,
27
+ "warmup_steps": 0,
28
+ "final_lr_fraction": 0.1,
29
+ "optimizer": {
30
+ "name": "muonh",
31
+ "matrix_lr": 0.014,
32
+ "scalar_lr": null,
33
+ "matrix_weight_decay": 0.0,
34
+ "scalar_weight_decay": 0.0,
35
+ "embedding_lr": 0.3,
36
+ "unembedding_lr": 0.004,
37
+ "norm_lr": 0.005,
38
+ "other_lr": 0.005,
39
+ "betas": [
40
+ 0.8,
41
+ 0.95
42
+ ],
43
+ "eps": 1e-10,
44
+ "normuon_momentum": 0.95,
45
+ "normuon_beta2": 0.95,
46
+ "normuon_nesterov": true,
47
+ "normuon_adjust_lr": "spectral_norm",
48
+ "max_grad_norm": null
49
+ },
50
+ "schedule": {
51
+ "kind": "linear",
52
+ "warmup_steps": 0,
53
+ "cooldown_fraction": 0.0,
54
+ "cooldown_style": "linear",
55
+ "final_lr_fraction": 0.1,
56
+ "z_loss_coefficient": 0.0,
57
+ "adamc_weight_decay": false
58
+ },
59
+ "group_weight_decay": {
60
+ "matrix": 0.0,
61
+ "embedding": 0.0,
62
+ "unembedding": 0.0,
63
+ "norm": 0.0,
64
+ "other": 0.0
65
+ },
66
+ "recipe_overrides": {},
67
+ "requested_batch_tokens": 262144,
68
+ "sequence_length": 2048,
69
+ "batch_assumptions": {
70
+ "global_batch_tokens": 262144,
71
+ "sequence_length": 2048,
72
+ "round_up": false
73
+ },
74
+ "lr_transfer": "mup_hyperp_released_source",
75
+ "assumptions": [],
76
+ "backend_kernel_assumptions": {},
77
+ "paper_settings_overridden": false,
78
+ "model": {
79
+ "backbone_profile": "paper2604_vanilla",
80
+ "source_commit": "122366472a31e57982a2877eeee10bb115477713",
81
+ "width_scale": 22,
82
+ "hidden_size": 1408,
83
+ "num_layers": 20,
84
+ "head_dim": 128,
85
+ "num_attention_heads": 11,
86
+ "num_kv_heads": 11,
87
+ "ffn_hidden_size": 5632,
88
+ "activation": "squared_relu",
89
+ "attention": "full_causal",
90
+ "attention_output_gate": false,
91
+ "qk_norm": "functional_rmsnorm_after_rope",
92
+ "norm_epsilon": 1e-06,
93
+ "model_level_norms": [
94
+ "embedding",
95
+ "recur",
96
+ "final"
97
+ ],
98
+ "rope_base": 10000.0,
99
+ "rope_convention": "split_half_negative_angle_bf16_cos_sin",
100
+ "bias": false,
101
+ "dropout": 0.0,
102
+ "residual_multiplier": 1.0,
103
+ "residual_and_norm_scale_dtype": "float32",
104
+ "projection_dtype": "bfloat16 (production)",
105
+ "tied_embeddings": false,
106
+ "vocab_size": 32001,
107
+ "padded_vocab_size": 32064,
108
+ "logit_softcap": 15.0,
109
+ "crop_padding_before_loss": true,
110
+ "initialization": {
111
+ "embedding_normal_std": 1.0,
112
+ "head_normal_std": 0.001,
113
+ "matrix_uniform_bound": "sqrt(3/fan_in)",
114
+ "norm_scale": 1.0
115
+ },
116
+ "parameter_counts": {
117
+ "non_embedding_matrix_formula": 475791360,
118
+ "non_embedding_paper_N": 475851904,
119
+ "total_trainable": 667263875,
120
+ "feedback_parameters": 3967744,
121
+ "loop_input_write_parameters": 1985280,
122
+ "loop_adapter_parameters": 95166723
123
+ },
124
+ "tokenizer_fidelity_note": "Released preprint/current code uses 32001 active tokens, padded to 32064; paper table reports 32008. Follow executable release; do not invent seven tokens.",
125
+ "execution_architecture": "full_bandwidth_loop",
126
+ "objective": "latent_feedback_causal_lm",
127
+ "feedback_enabled": true,
128
+ "train_passes": 3,
129
+ "eval_passes": 3,
130
+ "feedback_pass_mixture": {
131
+ "3": 1.0
132
+ },
133
+ "feedback_progressive_stages": [],
134
+ "depth_num_loops": 2,
135
+ "logical_layers_per_pass": 40,
136
+ "shared_layer_weights": true,
137
+ "depth_share_kv": false,
138
+ "depth_kv_policy": "recompute_each_loop",
139
+ "norm_placement": "embedding once; recur/final after loop 2 before three refiners; no post-refiner norm",
140
+ "loop_input_write": "ifm_diagonal",
141
+ "loop_input_write_source": "raw_token_embeddings",
142
+ "loop_input_write_placement": "before_every_depth_loop_after_initial_norm_emb",
143
+ "loop_input_write_sharing": "all_depth_loops_and_outer_feedback_passes",
144
+ "loop_input_write_init": "paper_matrix; a=b_delta=0; alpha=0.5; delta=log(2)",
145
+ "loop_final_adapter": "lookahead_refiner",
146
+ "loop_adapter": {
147
+ "ffn_size": 5632,
148
+ "state_input": "second-loop hidden states after norm_recur and norm_final",
149
+ "after_depth_loop": 2,
150
+ "applications_per_pass": 1,
151
+ "terminal_norms": true,
152
+ "attention_backend": "sdpa_auto",
153
+ "checkpoint_refiner": false,
154
+ "refiner_memory": true,
155
+ "refiner_memory_only": false,
156
+ "real_bank_read": true,
157
+ "memory_source": "each adapter block's input states; fresh each feedback pass",
158
+ "bank_layers": [
159
+ 0,
160
+ 10,
161
+ 19
162
+ ],
163
+ "bank_source": "first depth loop, fresh on each feedback pass",
164
+ "weight_sharing": "one adapter shared across feedback passes"
165
+ },
166
+ "block_application_multiplier_per_pass": 2.15,
167
+ "block_application_multiplier": 6.449999999999999
168
+ }
169
+ }